FASTA zaporedje (.fasta)

Bioinformatics Standard

FASTA je vsepovsod prisoten temeljni datotečni format bioinformatike in genomike, ki predstavlja nukleotidna zaporedja (DNA, RNA) in aminokislinska zaporedja beljakovin z uporabo univerzalnih enočrkovnih kod.

Pretvori FASTA v GENBANK

Brezplačen pretvornik iz FASTA v GENBANK v brskalniku. Pretvorite datoteke takoj v svoji napravi.

Pregled in metapodatki

Operacijski sistemi in analizatorji datotek identificirajo datoteke FASTA s pregledom vodilnega binarnega zaporedja bajtov:

Izberite ali povlecite datoteke sem

100-odstotno zasebna pretvorba v brskalniku - datoteke nikoli ne zapustijo vaše naprave

ali prilepi Ctrl+V
Jamstvo o zasebnosti brez prenosa podatkov v omrežje: 0 bajtov naloženih na zunanje strežnike. Vsa obdelava je potekala lokalno v varnem območju vašega brskalnika.

Podpis glave na ravni bajtov (Čarobni bajti)

Operacijski sistemi in analizatorji datotek identificirajo datoteke FASTA s pregledom vodilnega binarnega zaporedja bajtov:

PODPIS HEX (ZAMIK 0):

3E

REPREZENTACIJA ASCII: >

Standardizacija: Bioinformatics de facto global standard

Tehnične specifikacije

Arhitektura vsebnikaPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
StiskanjeUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Vrstni red bajtovASCII / UTF-8 text stream
Barvni prostoriN/A (Genomic Sequence Data)
Kanali in strukturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Največje dimenzijeUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ProsojnostNone
Pretočno in progresivno predvajanjeSequential record-by-record streaming processing

Tehnična primerjalna matrika: FASTA proti konkurenci

Tehnični atributFASTA (Trenutno)FASTQGENBANKGFF
Ocene kakovostiBrez (čiste črke zaporedja)Ocene kakovosti Phred na bazoBrez (anotacije funkcij)Brez (koordinate funkcij)
Vrstica glaveSe začne z znakom '>'Se začne z znakom '@'Strukturirani blok LOCUSGenomski stolpci, ločeni s tabulatorji
Glavna uporabaReferenčni genomi in iskanje BLASTSurovi visokozmogljivi sekvenčniki (Illumina)Obsežni anotirani geniAnotacije genomskih značilnosti
Velikost datoteke (človek)~3 gigabajti nestisnjeno~100+ gigabajtov (s kakovostmi)Večgigabajtno obogateno besedilo~50 megabajtov

Pogosti načini okvar in vodič za heksadecimalno obnovo

Bioinformatsko orodje poroča o 'Neveljaven znak zaporedja v vrstici X'.

Glavni vzrok: Presledki, številke ali znaki, ki niso po IUPAC, znotraj vrstic zaporedja.

Sanacija: Filtrirajte in očistite znake zaporedja z uporabo orodja File2File Bioinformatics Tool.

Varnostna analiza in napadalni vektorji razčlenjevalnika

Genomska orodja razčlenjujejo obsežne večgigabajtne datoteke FASTA, pri čemer lahko pri indeksiranju koordinat zaporedja pride do prekoračitve celih števil (integer overflow).

Znani vektorji napada

  • Prekoračitev celih števil v 32-bitnih indeksirih zaporedij (FAI), ki presegajo 2^31 baznih parov.
  • Prekoračitev med pomnilnikom pri branju pretirano dolgih glav identifikatorjev zaporedja.
  • Zavrnitev storitve prek patoloških poizvedb o poravnavi.

Obrambne najboljše prakse:

Zgodovinski izvor in mejniki

2003Projekt človeškega genoma zaključi prvo sekvenciranje človeškega genoma in objavi rezultate v formatu FASTA.
1990Orodje BLAST (Basic Local Alignment Search Tool) sprejme FASTA kot svoj standardni vhodni format.
1985William Pearson in David Lipman predstavita FASTA s programsko opremo za poravnavo zaporedij FASTP.

Ključne prednosti

  • Nesporni svetovni standard računalniške biologije: uporabljajo ga vsa genomska orodja, sekvenčniki in baze podatkov na Zemlji.
  • Izjemna preprostost: 1. vrstica se začne z '>' in ID-jem, ki mu sledijo gola besedilna genetska pisma.
  • Zmogljivost več zaporedij: ena sama datoteka lahko vsebuje tisoče posameznih genov ali popolnih virusnih genomov.

Tehnične omejitve in slabosti

  • Ne vsebuje rezultatov kakovosti sekvenciranja (za razliko od FASTQ, ki shranjuje ocene zaupanja Phred na osnovo).
  • Brez standardizirane sintakse metapodatkov za glave vrstic z izjemo začetnega identifikatorja.
  • Ogromen prostor za shranjevanje za podatkovne zbirke celotnega genoma brez Gzipa ali specializirane genomske kompresije.

Zanimive tehnične malenkosti

  • Celoten človeški genom s 3 milijardami baznih parov je mogoče predstaviti v formatu FASTA, kar zasede približno 3 gigabajte prostora za shranjevanje.
  • Štiri črke DNK, shranjene v datotekah FASTA, so A (adenin), C (citozin), G (gvanin) in T (timin).
  • Ko je bil genom koronavirusa COVID-19 januarja 2020 prvič sekvenciran, so ga znanstveniki delili po vsem svetu kot datoteko FASTA s 30.000 črkami.

Pogosta tehnična vprašanja

Kaj je datoteka FASTA?

Datoteka FASTA je navadna besedilna datoteka, ki se uporablja v biologiji za shranjevanje zaporedij DNK, RNA ali beljakovin z uporabo enočrkovnih okrajšav.

Kakšna je razlika med FASTA in FASTQ?

FASTA shrani samo črke genetskega zaporedja, medtem ko FASTQ shrani tako črke kot tudi oceno kakovosti točnosti zaporedja za vsako osnovo.

Kako si lahko ogledam datoteko FASTA?

Datoteke FASTA lahko odprete v katerem koli urejevalniku besedila, si jih ogledate v programski opremi za bioinformatiko, kot sta Jalview ali UGENE, ali pa jih pretvorite z uporabo File2File.app.