FASTA-sekvenssi (.fasta)
Bioinformatics StandardiFASTA on bioinformatiikan ja genomiikan kaikkialla läsnä oleva perusta tiedostomuotona, joka esittää nukleotidisekvenssejä (DNA, RNA) ja aminohappoproteiinisekvenssejä käyttämällä yleismaailmallisia yksikirjaimisia koodeja.
Muunna tiedostot muodosta FASTA muotoon GENBANK
Ilmainen selaimen sisäinen FASTA - GENBANK-muunnin. Muunna tiedostoja välittömästi laitteellasi.
Tarkastele ja metatiedot
Käyttöjärjestelmät ja tiedostoanalyysaattorit tunnistavat FASTA-tiedostot tarkistamalla tiedoston alun binäärisarjan:
Tavutason otsikon allekirjoitus (Magic Bytes)
Käyttöjärjestelmät ja tiedostoanalyysaattorit tunnistavat FASTA-tiedostot tarkistamalla tiedoston alun binäärisarjan:
HEX-ALLEKIRJOITUS (OFFSET 0):
3EASCII-ESITYSTAPA: >
Standardointi: Bioinformatics de facto global standard
Tekniset tiedot
| Säiliöarkkitehtuuri | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Pakkaus | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Tavujärjestys (Endianness) | ASCII / UTF-8 text stream |
| Väriavaruudet | N/A (Genomic Sequence Data) |
| Kanavat ja rakenne | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Suurimmat mitat | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Läpinäkyvyys | None |
| Suoratoisto ja progressiivinen lataus | Sequential record-by-record streaming processing |
Tekninen vertailumatriisi: FASTA vs. kilpailijat
| Tekninen attribuutti | FASTA (Nykyinen) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Laatupisteet | Ei mitään (puhtaat sekvenssikirjaimet) | Emäskohtaiset Phred-laatupisteet | Ei mitään (ominaisuuksien huomautukset) | Ei mitään (ominaisuuksien koordinaatit) |
| Otsakerivi | Alkaa merkillä '>' | Alkaa merkillä '@' | Rakenteinen LOCUS-lohko | Sarakkeittain sarkaimilla erotellut genomisarakkeet |
| Ensisijainen käyttötarkoitus | Vertailugenomit ja BLAST-haku | Raaoat suuren suorituskyvyn sekvensoijat (Illumina) | Kattavat huomautetut geenit | Genomisten ominaisuuksien huomautukset |
| Tiedostokoko (ihminen) | ~3 gigatavua pakkaamattomana | ~100+ gigatavua (laatujen kanssa) | Monigigatavuinen rikas teksti | ~50 megatavua |
Yleiset korruptiotilat ja heksatietojehdotusopas
Bioinformatiikkatyökalu ilmoittaa 'Virheellinen sekvenssimerkki rivillä X'.
Perussyy: Tyhjemerkkejä, numeroita tai muita kuin IUPAC-merkkejä sekvenssirivien sisällä.
Korjaus: Suodata ja puhdista sekvenssimerkit File2File Bioinformatics Tool -työkalulla.
Turvallisuusanalyysi ja jäsenninhyökkäysvektorit
Genomiikkatyökalut jäsennöivät valtavia monigigatavuisia FASTA-tiedostoja, joissa voi esiintyä kokonaisluvun ylivuotoja indeksoitaessa sekvenssin koordinaatteja.
Tunnetut hyökkäysvektorit
- Kokonaisluvun ylivuoto 32-bittisissä sekvenssi-indeksoijissa (FAI), kun ylitetään 2^31 emäsparia.
- Puskurin ylivuoto luettaessa liian pitkiä sekvenssin tunnisteotsikoita.
- Palvelunestohyökkäys epänormaalien kohdistuskyselyjen kautta.
Parhaat puolustuskäytännöt:
Historia ja virstanpylväät
Tärkeimmät edut
- Laskennallisen biologian kiistaton maailmanlaajuinen standardi: käytössä jokaisessa genomityökalussa, sekvensoijassa ja tietokannassa maapallolla.
- Äärimmäinen yksinkertaisuus: rivi 1 alkaa merkillä '>' ja sitä seuraa tunniste, jota seuraavat pelkkää tekstiä olevat geneettiset kirjaimet.
- Monen sekvenssin kapasiteetti: yksi ainoa tiedosto voi sisältää tuhansia yksittäisiä geenejä tai täydellisiä viruksen genomeja.
Tekniset rajoitukset
- Ei sisällä sekvensoinnin laatupisteitä (toisin kuin FASTQ, joka tallentaa emäskohtaiset Phred-luottamuslukemat).
- Ei standardoitua metatietosynaksia otsakerveille alkuperäisen tunnisteen lisäksi.
- Valtava tallennustilan tarve kokogenomiaineistoille ilman Gzip-pakkausta tai erikoistunutta genomipakkausta.
Mielenkiintoisia teknisiä faktoja
- Koko ihmisen 3 miljardin emäsparin genomi voidaan esittää FASTA-muodossa, mikä vie noin 3 gigatavua tallennustilaa.
- DNA:n neljä kirjainta FASTA-tiedostoissa ovat A (adeniini), C (sytosiini), G (guaniini) ja T (tymiini).
- Kun COVID-19-koronaviruksen genomi sekvensoitiin ensimmäisen kerran tammikuussa 2020, tutkijat jakoivat sen maailmanlaajuisesti 30 000 kirjaimen FASTA-tiedostona.
Usein kysytyt tekniset kysymykset
Mikä on FASTA-tiedosto?
FASTA-tiedosto on pelkkä tekstitiedosto, jota käytetään biologiassa DNA-, RNA- tai proteiinisekvenssien tallentamiseen yksikirjaimisia lyhenteitä käyttäen.
Mikä ero on FASTA- ja FASTQ-tiedostojen välillä?
FASTA tallentaa vain geneettiset sekvenssikirjaimet, kun taas FASTQ tallentaa sekä kirjaimet että sekvensoinnin tarkkuuden laatupisteet jokaiselle emäkselle.
Miten voin tarkastella FASTA-tiedostoa?
Voit avata FASTA-tiedostoja missä tahansa tekstieditorissa, tarkastella niitä bioinformatiikkaohjelmistoissa kuten Jalview tai UGENE, tai muuntaa ne File2File.app-palvelun avulla.
Aiheeseen liittyvät FASTA-muunnosparit
Tavallisen FASTA-sekvenssin muuntaminen GenBank-muotoon lisää raakaan geneettiseen koodiin olennaisia biologisia annotaatioita ja metatietoja.
GenBank-tiedoston muuntaminen FASTA-sekvenssiksi poistaa annotaatiometatiedot ja jättää jäljelle vain nopeaan bioinformatiikka-analyysiin tarvittavat raa'at nukleotidi- tai aminohapposekvenssit.