FASTA secība (.fasta)
Bioinformatics StandartsFASTA ir bioinformātikas un ģenomikas visuresošs, fundamentāls failu formāts, kas attēlo nukleotīdu secības (DNS, RNS) un aminoskābju olbaltumvielu secības, izmantojot universālus vienburtu kodus.
Konvertēt FASTA uz GENBANK
Bezmaksas FASTA uz GENBANK konvertētājs pārlūkprogrammā. Konvertējiet failus uzreiz savā ierīcē.
Pārbaudīt un metadati
Operētājsistēmas un failu analizatori identificē FASTA failus, pārbaudot sākotnējo bināro baitu secību:
Baitu līmeņa galvenes paraksts (maģiskie baiti)
Operētājsistēmas un failu analizatori identificē FASTA failus, pārbaudot sākotnējo bināro baitu secību:
HEKSADECIMĀLAIS PARAKSTS (NOBĪDE 0):
3EASCII ATTEIOLOJUMS: >
Standartizācija: Bioinformatics de facto global standard
Tehniskās specifikācijas
| Konteinera arhitektūra | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Saspiešana | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Baitu secība | ASCII / UTF-8 text stream |
| Krāsu telpas | N/A (Genomic Sequence Data) |
| Kanāli un struktūra | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maks. izmēri | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Caurspīdīgums | None |
| Straumēšana un progresīvā ielāde | Sequential record-by-record streaming processing |
Tehniskā salīdzinājuma matrica: FASTA pret konkurentiem
| Tehniskais atribūts | FASTA (Pašreizējais) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kvalitātes rādītāji | Nav (tīras secības burti) | Phred kvalitātes rādītāji katram bāzei | Nav (iezīmju anotācijas) | Nav (iezīmju koordinātas) |
| Galvenes rinda | Sākas ar '>' zīmi | Sākas ar '@' zīmi | Strukturēts LOCUS bloks | Ar tabulatoru atdalītas ģenoma kolonnas |
| Galvenais lietojums | Atsauces genomi un BLAST meklēšana | Neapstrādāti augstas caurlaidības sekvenētāji (Illumina) | Visaptogši anotēti gēni | Ģenoma iezīmju anotācijas |
| Faila izmērs (cilvēka) | ~3 gigabaiti nesaspiesti | ~100+ gigabaiti (ar kvalitātēm) | Vairāku gigabaitu bagātināts teksts | ~50 megabaiti |
Biežākie bojājumu veidi un heksadecimālās atkopšanas ceļvedis
Bioinformātikas rīks ziņo: 'Nederīga secības rakstzīme rindā X'.
Pamatcēlonis: Atstarpes, skaitļi vai ne-IUPAC rakstzīmes secības rindās.
Atkopšana: Filtrējiet un notīriet secības rakstzīmes, izmantojot File2File Bioinformatics Tool.
Drošības analīze un parsētāja uzbrukuma vektori
Genomikas rīki analizē milzīgus vairāku gigabaitu FASTA failus, kur var rasties veselu skaitļu pārpildes, indeksējot secības koordinātas.
Zināmie uzbrukuma vektori
- Veselu skaitļu pārpilde 32 bitu secību indeksētājos (FAI), pārsniedzot 2^31 bāžu pārus.
- Bufera pārpilde, nolasot pārmērīgi garas secības identifikatora galvenes.
- Pakalpojuma atteikums (DoS), izmantojot patoloģiskus izlīdzināšanas vaicājumus.
Aizsardzības labākā prakse:
Vēsturiskā izcelsme un pavērsieni
Galvenās priekšrocības un plusi
- Neapstrīdams skaitļošanas bioloģijas globālais standarts: to izmanto visi genoma rīki, sekvenētāji un datu bāzes uz Zemes.
- Ārkārtīga vienkāršība: 1. rinda sākas ar '>' simbolu, kam seko ID un vienkārša teksta ģenētiskie burti.
- Vairāku secību kapacitāte: viens fails var saturēt tūkstošiem atsevišķu gēnu vai pilnīgu vīrusu genomu.
Tehniskie ierobežojumi un mīnusi
- Nesatur sekvencēšanas kvalitātes rādītājus (atšķirībā no FASTQ, kas saglabā Phred ticamības rādītājus katram bāzes pārim).
- Nav standartizētas metadatu sintakses galvenes rindām, izņemot sākotnējo identifikatoru.
- Milzīga krātuves vietas aizņemšana visa genoma datu kopām bez Gzip vai specializētas genoma saspiešanas.
Interesanti tehniski fakti
- Visu 3 miljardus bāžu garo cilvēka genomu var attēlot FASTA formātā, aizņemot aptuveni 3 gigabaitus krātuves vietas.
- Četri DNS burti, kas saglabāti FASTA failos, ir A (adenīns), C (citozīns), G (guanīns) un T (timīns).
- Kad COVID-19 koronavīrusa genoms pirmo reizi tika sekvenēts 2020. gada janvārī, zinātnieki to kopīgoja visā pasaulē kā 30 000 burtu garu FASTA failu.
Bieži uzdotie tehniskie jautājumi
Kas ir FASTA fails?
FASTA fails ir vienkārša teksta fails, ko bioloģijā izmanto DNS, RNS vai olbaltumvielu sekvenču glabāšanai, izmantojot vienas burta saīsinājumus.
Kāda ir atšķirība starp FASTA un FASTQ?
FASTA saglabā tikai ģenētiskās secības burtus, savukārt FASTQ saglabā gan burtus, gan secības precizitātes kvalitātes rādītāju katrai bāzei.
Kā varu apskatīt FASTA failu?
Varat atvērt FASTA failus jebkurā teksta redaktorā, apskatīt tos bioinformātikas programmatūrā, piemēram, Jalview vai UGENE, vai konvertēt tos, izmantojot File2File.app.
Saistītie FASTA konvertēšanas pāri
Parasta FASTA secences pārveidošana GenBank failā pievieno nepieciešamās bioloģiskās anotācijas un metadatus neapstrādātajam ģenētiskajam kodam.
GenBank faila konvertēšana uz FASTA secību notīra anotācijas metadatus, atstājot tikai neapstrādātās nukleotīdu vai aminoskābju secības, kas nepieciešamas ātrai bioinformātikas analīzei.