FASTA-järjestus (.fasta)
Bioinformatics StandardFASTA on bioinformaatika ja genoomika üldlevinud ja aluseline failivorming, mis esindab nukleotiidide (DNA, RNA) ja aminohapete valgujärjestusi universaalsete ühetäheliste koodide abil.
Teisenda formaadist FASTA formaati GENBANK
Tasuta FASTA -> GENBANK konverter brauseris. Teisenda faile koheselt oma seadmes.
Kontrolli ja metaandmed
Operatsioonisüsteemid ja failianalüsaatorid tuvastavad FASTA faile, kontrollides algset binaarset baidijada:
Baidi-taseme päise allkiri (maagilised baidid)
Operatsioonisüsteemid ja failianalüsaatorid tuvastavad FASTA faile, kontrollides algset binaarset baidijada:
HEX-ALLKIRI (NIHE 0):
3EASCII-ESITUS: >
Standardiseerimine: Bioinformatics de facto global standard
Tehnilised andmed
| Konteineri arhitektuur | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Tihendamine | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Baitide järjekord (Endianness) | ASCII / UTF-8 text stream |
| Värviruumid | N/A (Genomic Sequence Data) |
| Kanalid ja struktuur | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Max mõõtmed | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Läbipaistvus | None |
| Voogedastus ja progressiivsus | Sequential record-by-record streaming processing |
Tehniline võrdlusmaatriks: FASTA vs konkurendid
| Tehniline atribuut | FASTA (Praegune) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kvaliteediskoorid | Puuduvad (puhtad järjestuse tähed) | Alusepõhised Phredi kvaliteediskoorid | Puuduvad (tunnuste annotatsioonid) | Puuduvad (tunnuste koordinaadid) |
| Päiserida | Algab märgiga '>' | Algab märgiga '@' | Struktureeritud LOCUS-plokk | Tabeldusmärgiga eraldatud genoomiveerud |
| Peamine kasutus | Võrdlusgenoomid ja BLAST-otsing | Toored suure läbilaskvusega sekveneerijad (Illumina) | Põhjalikud annoteeritud genoomid | Genoomsete tunnuste annotatsioonid |
| Faili suurus (Inimene) | ~3 gigabaiti tihendamata | ~100+ gigabaiti (koos kvaliteetidega) | Mitme gigabidi suurune rikkalik tekst | ~50 megabaiti |
Levinud riknemisvead ja heksataaste juhend
Bioinformaatika tööriist raporteerib vea: 'Vigane järjestuse märk real X'.
Juurpõhjus: Tühikud, numbrid või mitte-IUPAC-märgid järjestuse ridades.
Taastamine: Filtreerige ja puhastage järjestuse märke File2File bioinformaatika tööriistaga.
Turvaanalüüs ja parsimisründevektorid
Genoomikatööriistad parsivad massiivseid mitme gigabaidiseid FASTA-faile, kus järjestuse koordinaatide indekseerimisel võib esineda täisarvu ületäitumisi.
Teadaolevad ründavektorid
- Täisarvu ületäitumine 32-bitistes järjestuse indekseerijates (FAI), mis ületavad 2^31 aluspaari.
- Puhvri ületäitumine liiga pikkade järjestuse identifikaatori päiste lugemisel.
- Teenusetõkestus (DoS) patoloogiliste joonduspäringute kaudu.
Kaitsealased parimad tavad:
Ajalooline taust ja verstapostid
Peamised eelised
- Arvutusliku bioloogia vaieldamatu globaalne standard: kasutusel igal genoomitööriistal, sekveneerijal ja andmebaasil Maal.
- Äärmiselt lihtne: 1. rida algab märgiga '>' ja sellele järgneb identifikaator ning lihttekstina geneetilised tähed.
- Mitme järjestuse mahutavus: üksainus fail võib sisaldada tuhandeid eraldi geene või terviklikke viirusegenoome.
Tehnilised piirangud ja puudused
- Ei sisalda sekveneerimise kvaliteediskoore (erinevalt FASTQ-st, mis salvestab alusepõhiseid Phredi usaldusväärsusskoore).
- Puudub standardiseeritud metaandmete süntaks päiseridade jaoks lisaks esialgsele identifikaatorile.
- Hiiglaslik salvestusruumi vajadus täisgenoomi andmekogumite jaoks ilma Gzipi või spetsiaalse genoomse tihenduseta.
Huvitavaid tehnilisi fakte
- Kogu inimese 3 miljardi aluspaariline genoom on esitatav FASTA vormingus, võttes ruumi umbes 3 gigabaiti.
- FASTA-failides salvestatud DNA neli tähte on A (adeniin), C (tsütosiin), G (guaniin) ja T (tümiin).
- Kui COVID-19 koroonaviiruse genoom sekveneeriti esmakordselt 2020. aasta jaanuaris, jagasid teadlased seda ülemaailmselt 30 000-tähelise FASTA-failina.
Korduma kippuvad tehnilised küsimused
Mis on FASTA-fail?
FASTA-fail on bioloogias kasutatav lihttekstifail DNA, RNA või proteiinijärjestuste salvestamiseks ühebitiste lühendite abil.
Mis vahe on FASTA-l ja FASTQ-l?
FASTA salvestab ainult geneetilise järjestuse tähti, samas kui FASTQ salvestab iga aluse jaoks nii tähed kui ka sekveneerimise täpsuse kvaliteediskoori.
Kuidas ma saan FASTA-faili vaadata?
Saate avada FASTA-failid mis tahes tekstiredaktoris, vaadata neid bioinformaatika tarkvaras nagu Jalview või UGENE, või teisendada neid File2File.app-i abil.
Seotud FASTA teisenduspaarid
Lihtsa FASTA järjestuse teisendamine GenBanki lihtfailiks lisab toorele geneetilisele koodile olulised bioloogilised annotatsioonid ja metaandmed.
GenBanki lihtfaili teisendamine FASTA järjestuseks eemaldab annotatsiooni metaandmed, jättes alles ainult toored nukleotiidi- või aminohappejärjestused, mida on vaja kiireks bioinformaatikaga analüüsiks.