FASTA zaporedje (.fasta)
Bioinformatics StandardFASTA je vsepovsod prisoten temeljni datotečni format bioinformatike in genomike, ki predstavlja nukleotidna zaporedja (DNA, RNA) in aminokislinska zaporedja beljakovin z uporabo univerzalnih enočrkovnih kod.
Pretvori FASTA v GENBANK
Brezplačen pretvornik iz FASTA v GENBANK v brskalniku. Pretvorite datoteke takoj v svoji napravi.
Pregled in metapodatki
Operacijski sistemi in analizatorji datotek identificirajo datoteke FASTA s pregledom vodilnega binarnega zaporedja bajtov:
Podpis glave na ravni bajtov (Čarobni bajti)
Operacijski sistemi in analizatorji datotek identificirajo datoteke FASTA s pregledom vodilnega binarnega zaporedja bajtov:
PODPIS HEX (ZAMIK 0):
3EREPREZENTACIJA ASCII: >
Standardizacija: Bioinformatics de facto global standard
Tehnične specifikacije
| Arhitektura vsebnika | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Stiskanje | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Vrstni red bajtov | ASCII / UTF-8 text stream |
| Barvni prostori | N/A (Genomic Sequence Data) |
| Kanali in struktura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Največje dimenzije | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Prosojnost | None |
| Pretočno in progresivno predvajanje | Sequential record-by-record streaming processing |
Tehnična primerjalna matrika: FASTA proti konkurenci
| Tehnični atribut | FASTA (Trenutno) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Ocene kakovosti | Brez (čiste črke zaporedja) | Ocene kakovosti Phred na bazo | Brez (anotacije funkcij) | Brez (koordinate funkcij) |
| Vrstica glave | Se začne z znakom '>' | Se začne z znakom '@' | Strukturirani blok LOCUS | Genomski stolpci, ločeni s tabulatorji |
| Glavna uporaba | Referenčni genomi in iskanje BLAST | Surovi visokozmogljivi sekvenčniki (Illumina) | Obsežni anotirani geni | Anotacije genomskih značilnosti |
| Velikost datoteke (človek) | ~3 gigabajti nestisnjeno | ~100+ gigabajtov (s kakovostmi) | Večgigabajtno obogateno besedilo | ~50 megabajtov |
Pogosti načini okvar in vodič za heksadecimalno obnovo
Bioinformatsko orodje poroča o 'Neveljaven znak zaporedja v vrstici X'.
Glavni vzrok: Presledki, številke ali znaki, ki niso po IUPAC, znotraj vrstic zaporedja.
Sanacija: Filtrirajte in očistite znake zaporedja z uporabo orodja File2File Bioinformatics Tool.
Varnostna analiza in napadalni vektorji razčlenjevalnika
Genomska orodja razčlenjujejo obsežne večgigabajtne datoteke FASTA, pri čemer lahko pri indeksiranju koordinat zaporedja pride do prekoračitve celih števil (integer overflow).
Znani vektorji napada
- Prekoračitev celih števil v 32-bitnih indeksirih zaporedij (FAI), ki presegajo 2^31 baznih parov.
- Prekoračitev med pomnilnikom pri branju pretirano dolgih glav identifikatorjev zaporedja.
- Zavrnitev storitve prek patoloških poizvedb o poravnavi.
Obrambne najboljše prakse:
Zgodovinski izvor in mejniki
Ključne prednosti
- Nesporni svetovni standard računalniške biologije: uporabljajo ga vsa genomska orodja, sekvenčniki in baze podatkov na Zemlji.
- Izjemna preprostost: 1. vrstica se začne z '>' in ID-jem, ki mu sledijo gola besedilna genetska pisma.
- Zmogljivost več zaporedij: ena sama datoteka lahko vsebuje tisoče posameznih genov ali popolnih virusnih genomov.
Tehnične omejitve in slabosti
- Ne vsebuje rezultatov kakovosti sekvenciranja (za razliko od FASTQ, ki shranjuje ocene zaupanja Phred na osnovo).
- Brez standardizirane sintakse metapodatkov za glave vrstic z izjemo začetnega identifikatorja.
- Ogromen prostor za shranjevanje za podatkovne zbirke celotnega genoma brez Gzipa ali specializirane genomske kompresije.
Zanimive tehnične malenkosti
- Celoten človeški genom s 3 milijardami baznih parov je mogoče predstaviti v formatu FASTA, kar zasede približno 3 gigabajte prostora za shranjevanje.
- Štiri črke DNK, shranjene v datotekah FASTA, so A (adenin), C (citozin), G (gvanin) in T (timin).
- Ko je bil genom koronavirusa COVID-19 januarja 2020 prvič sekvenciran, so ga znanstveniki delili po vsem svetu kot datoteko FASTA s 30.000 črkami.
Pogosta tehnična vprašanja
Kaj je datoteka FASTA?
Datoteka FASTA je navadna besedilna datoteka, ki se uporablja v biologiji za shranjevanje zaporedij DNK, RNA ali beljakovin z uporabo enočrkovnih okrajšav.
Kakšna je razlika med FASTA in FASTQ?
FASTA shrani samo črke genetskega zaporedja, medtem ko FASTQ shrani tako črke kot tudi oceno kakovosti točnosti zaporedja za vsako osnovo.
Kako si lahko ogledam datoteko FASTA?
Datoteke FASTA lahko odprete v katerem koli urejevalniku besedila, si jih ogledate v programski opremi za bioinformatiko, kot sta Jalview ali UGENE, ali pa jih pretvorite z uporabo File2File.app.
Sorodni pari pretvorbe za FASTA
Pretvorba navadne zaporedne datoteke FASTA v ravno datoteko GenBank dodaja bistvene biološke opombe in metapodatke k surovi genski kodi.
Pretvorba ravne datoteke GenBank v zaporedje FASTA odstrani metapodatke opomb, tako da ostanejo le surova nukleotidna ali aminokislinska zaporedja, potrebna za hitro bioinformatsko analizo.