FASTA-järjestus (.fasta)

Bioinformatics Standard

FASTA on bioinformaatika ja genoomika üldlevinud ja aluseline failivorming, mis esindab nukleotiidide (DNA, RNA) ja aminohapete valgujärjestusi universaalsete ühetäheliste koodide abil.

Teisenda formaadist FASTA formaati GENBANK

Tasuta FASTA -> GENBANK konverter brauseris. Teisenda faile koheselt oma seadmes.

Kontrolli ja metaandmed

Operatsioonisüsteemid ja failianalüsaatorid tuvastavad FASTA faile, kontrollides algset binaarset baidijada:

Vali või lohista failid siia

100% privaatne konversioon brauseris - failid ei lahku kunagi sinu seadmest

või kleebi Ctrl+V
Null-võrguülekande privaatsusgarantii: 0 baiti laaditakse üles välistesse serveritesse. Kogu töötlemine toimub lokaalselt sinu brauseri liivakastis.

Baidi-taseme päise allkiri (maagilised baidid)

Operatsioonisüsteemid ja failianalüsaatorid tuvastavad FASTA faile, kontrollides algset binaarset baidijada:

HEX-ALLKIRI (NIHE 0):

3E

ASCII-ESITUS: >

Standardiseerimine: Bioinformatics de facto global standard

Tehnilised andmed

Konteineri arhitektuurPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
TihendamineUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Baitide järjekord (Endianness)ASCII / UTF-8 text stream
VärviruumidN/A (Genomic Sequence Data)
Kanalid ja struktuurNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Max mõõtmedUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
LäbipaistvusNone
Voogedastus ja progressiivsusSequential record-by-record streaming processing

Tehniline võrdlusmaatriks: FASTA vs konkurendid

Tehniline atribuutFASTA (Praegune)FASTQGENBANKGFF
KvaliteediskooridPuuduvad (puhtad järjestuse tähed)Alusepõhised Phredi kvaliteediskooridPuuduvad (tunnuste annotatsioonid)Puuduvad (tunnuste koordinaadid)
PäiseridaAlgab märgiga '>'Algab märgiga '@'Struktureeritud LOCUS-plokkTabeldusmärgiga eraldatud genoomiveerud
Peamine kasutusVõrdlusgenoomid ja BLAST-otsingToored suure läbilaskvusega sekveneerijad (Illumina)Põhjalikud annoteeritud genoomidGenoomsete tunnuste annotatsioonid
Faili suurus (Inimene)~3 gigabaiti tihendamata~100+ gigabaiti (koos kvaliteetidega)Mitme gigabidi suurune rikkalik tekst~50 megabaiti

Levinud riknemisvead ja heksataaste juhend

Bioinformaatika tööriist raporteerib vea: 'Vigane järjestuse märk real X'.

Juurpõhjus: Tühikud, numbrid või mitte-IUPAC-märgid järjestuse ridades.

Taastamine: Filtreerige ja puhastage järjestuse märke File2File bioinformaatika tööriistaga.

Turvaanalüüs ja parsimisründevektorid

Genoomikatööriistad parsivad massiivseid mitme gigabaidiseid FASTA-faile, kus järjestuse koordinaatide indekseerimisel võib esineda täisarvu ületäitumisi.

Teadaolevad ründavektorid

  • Täisarvu ületäitumine 32-bitistes järjestuse indekseerijates (FAI), mis ületavad 2^31 aluspaari.
  • Puhvri ületäitumine liiga pikkade järjestuse identifikaatori päiste lugemisel.
  • Teenusetõkestus (DoS) patoloogiliste joonduspäringute kaudu.

Kaitsealased parimad tavad:

Ajalooline taust ja verstapostid

2003Inimese genoomi projekt lõpetab inimgenoomi esimese sekveneerimise, avaldades tulemused FASTA vormingus.
1990BLAST (Basic Local Alignment Search Tool) võtab FASTA kasutusele oma standardse sisendvorminguna.
1985William Pearson ja David Lipman tutvustavad FASTA-t koos FASTP järjestuse joondamise tarkvaraga.

Peamised eelised

  • Arvutusliku bioloogia vaieldamatu globaalne standard: kasutusel igal genoomitööriistal, sekveneerijal ja andmebaasil Maal.
  • Äärmiselt lihtne: 1. rida algab märgiga '>' ja sellele järgneb identifikaator ning lihttekstina geneetilised tähed.
  • Mitme järjestuse mahutavus: üksainus fail võib sisaldada tuhandeid eraldi geene või terviklikke viirusegenoome.

Tehnilised piirangud ja puudused

  • Ei sisalda sekveneerimise kvaliteediskoore (erinevalt FASTQ-st, mis salvestab alusepõhiseid Phredi usaldusväärsusskoore).
  • Puudub standardiseeritud metaandmete süntaks päiseridade jaoks lisaks esialgsele identifikaatorile.
  • Hiiglaslik salvestusruumi vajadus täisgenoomi andmekogumite jaoks ilma Gzipi või spetsiaalse genoomse tihenduseta.

Huvitavaid tehnilisi fakte

  • Kogu inimese 3 miljardi aluspaariline genoom on esitatav FASTA vormingus, võttes ruumi umbes 3 gigabaiti.
  • FASTA-failides salvestatud DNA neli tähte on A (adeniin), C (tsütosiin), G (guaniin) ja T (tümiin).
  • Kui COVID-19 koroonaviiruse genoom sekveneeriti esmakordselt 2020. aasta jaanuaris, jagasid teadlased seda ülemaailmselt 30 000-tähelise FASTA-failina.

Korduma kippuvad tehnilised küsimused

Mis on FASTA-fail?

FASTA-fail on bioloogias kasutatav lihttekstifail DNA, RNA või proteiinijärjestuste salvestamiseks ühebitiste lühendite abil.

Mis vahe on FASTA-l ja FASTQ-l?

FASTA salvestab ainult geneetilise järjestuse tähti, samas kui FASTQ salvestab iga aluse jaoks nii tähed kui ka sekveneerimise täpsuse kvaliteediskoori.

Kuidas ma saan FASTA-faili vaadata?

Saate avada FASTA-failid mis tahes tekstiredaktoris, vaadata neid bioinformaatika tarkvaras nagu Jalview või UGENE, või teisendada neid File2File.app-i abil.