FASTA secība (.fasta)

Bioinformatics Standarts

FASTA ir bioinformātikas un ģenomikas visuresošs, fundamentāls failu formāts, kas attēlo nukleotīdu secības (DNS, RNS) un aminoskābju olbaltumvielu secības, izmantojot universālus vienburtu kodus.

Konvertēt FASTA uz GENBANK

Bezmaksas FASTA uz GENBANK konvertētājs pārlūkprogrammā. Konvertējiet failus uzreiz savā ierīcē.

Pārbaudīt un metadati

Operētājsistēmas un failu analizatori identificē FASTA failus, pārbaudot sākotnējo bināro baitu secību:

Atlasiet vai velciet failus šeit

100% privāta konvertēšana pārlūkprogrammā - faili nekad neatstāj jūsu ierīci

vai ielīmējiet Ctrl+V
Privātuma garantija bez datu pārraides tīklā: 0 baitu augšupielādēti ārējos serveros. Visa apstrāde notika lokāli jūsu pārlūkprogrammas smilškastē.

Baitu līmeņa galvenes paraksts (maģiskie baiti)

Operētājsistēmas un failu analizatori identificē FASTA failus, pārbaudot sākotnējo bināro baitu secību:

HEKSADECIMĀLAIS PARAKSTS (NOBĪDE 0):

3E

ASCII ATTEIOLOJUMS: >

Standartizācija: Bioinformatics de facto global standard

Tehniskās specifikācijas

Konteinera arhitektūraPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
SaspiešanaUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Baitu secībaASCII / UTF-8 text stream
Krāsu telpasN/A (Genomic Sequence Data)
Kanāli un struktūraNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maks. izmēriUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
CaurspīdīgumsNone
Straumēšana un progresīvā ielādeSequential record-by-record streaming processing

Tehniskā salīdzinājuma matrica: FASTA pret konkurentiem

Tehniskais atribūtsFASTA (Pašreizējais)FASTQGENBANKGFF
Kvalitātes rādītājiNav (tīras secības burti)Phred kvalitātes rādītāji katram bāzeiNav (iezīmju anotācijas)Nav (iezīmju koordinātas)
Galvenes rindaSākas ar '>' zīmiSākas ar '@' zīmiStrukturēts LOCUS bloksAr tabulatoru atdalītas ģenoma kolonnas
Galvenais lietojumsAtsauces genomi un BLAST meklēšanaNeapstrādāti augstas caurlaidības sekvenētāji (Illumina)Visaptogši anotēti gēniĢenoma iezīmju anotācijas
Faila izmērs (cilvēka)~3 gigabaiti nesaspiesti~100+ gigabaiti (ar kvalitātēm)Vairāku gigabaitu bagātināts teksts~50 megabaiti

Biežākie bojājumu veidi un heksadecimālās atkopšanas ceļvedis

Bioinformātikas rīks ziņo: 'Nederīga secības rakstzīme rindā X'.

Pamatcēlonis: Atstarpes, skaitļi vai ne-IUPAC rakstzīmes secības rindās.

Atkopšana: Filtrējiet un notīriet secības rakstzīmes, izmantojot File2File Bioinformatics Tool.

Drošības analīze un parsētāja uzbrukuma vektori

Genomikas rīki analizē milzīgus vairāku gigabaitu FASTA failus, kur var rasties veselu skaitļu pārpildes, indeksējot secības koordinātas.

Zināmie uzbrukuma vektori

  • Veselu skaitļu pārpilde 32 bitu secību indeksētājos (FAI), pārsniedzot 2^31 bāžu pārus.
  • Bufera pārpilde, nolasot pārmērīgi garas secības identifikatora galvenes.
  • Pakalpojuma atteikums (DoS), izmantojot patoloģiskus izlīdzināšanas vaicājumus.

Aizsardzības labākā prakse:

Vēsturiskā izcelsme un pavērsieni

2003Cilvēka genoma projekts pabeidz pirmo cilvēka genoma sekvencēšanu, publicējot rezultātus FASTA formātā.
1990BLAST (Basic Local Alignment Search Tool) pieņem FASTA kā savu standarta ievades formātu.
1985Viljams Pīrsons (William Pearson) un Deivids Lipmens (David Lipman) ievieš FASTA kopā ar FASTP secības izlīdzināšanas programmatūru.

Galvenās priekšrocības un plusi

  • Neapstrīdams skaitļošanas bioloģijas globālais standarts: to izmanto visi genoma rīki, sekvenētāji un datu bāzes uz Zemes.
  • Ārkārtīga vienkāršība: 1. rinda sākas ar '>' simbolu, kam seko ID un vienkārša teksta ģenētiskie burti.
  • Vairāku secību kapacitāte: viens fails var saturēt tūkstošiem atsevišķu gēnu vai pilnīgu vīrusu genomu.

Tehniskie ierobežojumi un mīnusi

  • Nesatur sekvencēšanas kvalitātes rādītājus (atšķirībā no FASTQ, kas saglabā Phred ticamības rādītājus katram bāzes pārim).
  • Nav standartizētas metadatu sintakses galvenes rindām, izņemot sākotnējo identifikatoru.
  • Milzīga krātuves vietas aizņemšana visa genoma datu kopām bez Gzip vai specializētas genoma saspiešanas.

Interesanti tehniski fakti

  • Visu 3 miljardus bāžu garo cilvēka genomu var attēlot FASTA formātā, aizņemot aptuveni 3 gigabaitus krātuves vietas.
  • Četri DNS burti, kas saglabāti FASTA failos, ir A (adenīns), C (citozīns), G (guanīns) un T (timīns).
  • Kad COVID-19 koronavīrusa genoms pirmo reizi tika sekvenēts 2020. gada janvārī, zinātnieki to kopīgoja visā pasaulē kā 30 000 burtu garu FASTA failu.

Bieži uzdotie tehniskie jautājumi

Kas ir FASTA fails?

FASTA fails ir vienkārša teksta fails, ko bioloģijā izmanto DNS, RNS vai olbaltumvielu sekvenču glabāšanai, izmantojot vienas burta saīsinājumus.

Kāda ir atšķirība starp FASTA un FASTQ?

FASTA saglabā tikai ģenētiskās secības burtus, savukārt FASTQ saglabā gan burtus, gan secības precizitātes kvalitātes rādītāju katrai bāzei.

Kā varu apskatīt FASTA failu?

Varat atvērt FASTA failus jebkurā teksta redaktorā, apskatīt tos bioinformātikas programmatūrā, piemēram, Jalview vai UGENE, vai konvertēt tos, izmantojot File2File.app.