FASTA sekvenca (.fasta)
Bioinformatics StandardnoFASTA je posvuda prisutan, temeljni format datoteke u bioinformatici i genomici, koji predstavlja nukleotidne sekvence (DNA, RNA) i aminokiselinske proteinske sekvence koristeći univerzalne jednokratne kodove s jednim slovom.
Pretvori FASTA u GENBANK
Besplatni FASTA u GENBANK pretvarač u pregledniku. Trenutno pretvorite datoteke na svom uređaju.
Pregledaj i metapodaci
Operativni sustavi i alati za analizu datoteka identificiraju FASTA datoteke provjerom početnog niza binarnih bajtova:
Potpis zaglavlja na razini bajtova (Magic Bytes)
Operativni sustavi i alati za analizu datoteka identificiraju FASTA datoteke provjerom početnog niza binarnih bajtova:
HEX POTPIS (POMAK 0):
3EASCII PRIKAZ: >
Standardizacija: Bioinformatics de facto global standard
Tehničke specifikacije
| Arhitektura spremnika | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Kompresija | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| 字节序 | ASCII / UTF-8 text stream |
| Prostori boja | N/A (Genomic Sequence Data) |
| Kanali i struktura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maksimalne dimenzije | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Prozirnost | None |
| Streaming i progresivno | Sequential record-by-record streaming processing |
Tehnička matrica usporedbe: FASTA vs Konkurencija
| Tehnički atribut | FASTA (Trenutno) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Rezultati kvalitete | Nema (čista slova sekvence) | Phred ocjene kvalitete po bazi | Nema (oznake značajki) | Nema (koordinate značajki) |
| Redak zaglavlja | Započinje znakom '>' | Započinje znakom '@' | Strukturirani LOCUS blok | Genomski stupci odvojeni tabulatorom |
| Primarna upotreba | Referentni genomi i BLAST pretraga | Sirovi visokopropusni sekvencatori (Illumina) | Sveobuhvatni anotirani geni | Anotacije genomskih značajki |
| Veličina datoteke (Ljudski) | ~3 gigabajta nekomprimirano | ~100+ gigabajta (s kvalitetama) | Višegigabajtni obogaćeni tekst | ~50 megabajta |
Uobičajeni načini oštećenja i vodič za heksadecimalni oporavak
Bioinformatički alat javlja 'Nevažeći znak sekvence u retku X'.
Temeljni uzrok: Bjeline, brojevi ili znakovi koji nisu IUPAC unutar redaka sekvence.
Oporavak: Filtrirajte i očistite znakove sekvence pomoću File2File alata za bioinformatiku.
Sigurnosna analiza i vektori napada na parser
Genomski alati analiziraju masivne višegigabajtne FASTA datoteke gdje može doći do prelijevanja cijelih brojeva (integer overflow) pri indeksiranju koordinata sekvence.
Poznati vektori napada
- Prelijevanje cijelih brojeva u 32-bitnim indekserima sekvenci (FAI) koji premašuju 2^31 baznih parova.
- Prelijevanje međuspremnika (buffer overflow) pri čitanju pretjerano dugih zaglavlja identifikatora sekvence.
- Uskaćivanje usluge (DoS) kroz patološke upite za poravnanje.
Najbolje obrambene prakse:
Povijesni izvori i prekretnice
Ključne prednosti
- Neprikosnoveni globalni standard računalne biologije: koriste ga svi genomski alati, sekvencatori i baze podataka na Zemlji.
- Iznimna jednostavnost: 1. red započinje s '>' praćen identifikatorom, a zatim običnim tekstom genetskih slova.
- Kapacitet za više sekvenci: jedna datoteka može sadržavati tisuće pojedinačnih gena ili potpune virusne genome.
Tehnička ograničenja i nedostaci
- Ne sadrži rezultate kvalitete sekvenciranja (za razliku od FASTQ-a, koji pohranjuje Phred ocjene pouzdanosti po bazi).
- Nema standardizirane sintakse metapodataka za zaglavlja osim početnog identifikatora.
- Ogroman otisak pohrane za skupove podataka cijelog genoma bez Gzipa ili specijalizirane genomske kompresije.
Zanimljive tehničke činjenice
- Cijeli ljudski genom s 3 milijarde baznih parova može se prikazati u FASTA formatu, zauzimajući otprilike 3 gigabajta pohrane.
- Četiri slova DNA pohranjena u FASTA datotekama su A (Adenin), C (Citozin), G (Guanin) i T (Timin).
- Kada je genom koronavirusa COVID-19 prvi put sekvenciran u siječnju 2020., znanstvenici su ga globalno podijelili kao FASTA datoteku s 30 000 slova.
Često postavljana tehnička pitanja
Što je FASTA datoteku?
FASTA datoteka je obična tekstualna datoteka koja se koristi u biologiji za pohranu DNK, RNA ili proteinskih sekvenci pomoću jednoslovnih kratica.
Koja je razlika između FASTA i FASTQ format?
FASTA pohranjuje samo slova genetske sekvence, dok FASTQ pohranjuje i slova i ocjenu točnosti sekvenciranja za svaku bazu.
Kako mogu pregledati FASTA datoteku?
FASTA datoteke možete otvoriti u bilo kojem uređivaču teksta, pregledati ih u računalno-biološkom softveru poput Jalview ili UGENE ili ih pretvoriti pomoću File2File.app.
Povezani parovi konverzije za FASTA
Pretvaranje obične FASTA sekvence u GenBank datoteku dodaje osnovne biološke anotacije i metapodatke sirovom genetskom kodu.
Pretvaranje GenBank datoteke u FASTA sekvencu uklanja metapodatke anotacija kako bi ostale samo sirove nukleotidne ili aminokiselinske sekvence potrebne za brzu bioinformatičku analizu.