FASTA sekvenca (.fasta)
Bioinformatics StandardnoFASTA je svuda prisutan, osnovni format datoteke u bioinformatici i genomici, koji predstavlja nukleotidne sekvence (DNA, RNA) i aminokiselinske proteinske sekvence koristeći univerzalne jednoslovne kodove.
Конвертујте FASTA у GENBANK
Бесплатан FASTA у GENBANK конвертор у прегледачу. Конвертујте фајлове тренутно без слања на сервер уз 100% приватност.
Pregledaj i metapodaci
Operativni sistemi i analizatori datoteka identifikuju FASTA datoteke proverom početnog binarnog niza bajtova:
Potpis zaglavlja na nivou bajtova (Magic Bytes)
Operativni sistemi i analizatori datoteka identifikuju FASTA datoteke proverom početnog binarnog niza bajtova:
HEX POTPIS (OFFSET 0):
3EASCII REPREZENTACIJA: >
Standardizacija: Bioinformatics de facto global standard
Tehničke specifikacije
| Arhitektura kontejnera | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Kompresija | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Bajtni redosled (Endianness) | ASCII / UTF-8 text stream |
| Prostori boja | N/A (Genomic Sequence Data) |
| Kanali i struktura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maksimalne dimenzije | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Transparentnost | None |
| Strimovanje i progresivno učitavanje | Sequential record-by-record streaming processing |
Tehnička matrica poređenja: FASTA vs Konkurenti
| Tehnički atribut | FASTA (Trenutno) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Ocene kvaliteta | Nema (čista slova sekvence) | Phred ocene kvaliteta po bazi | Nema (anotacije funkcija) | Nema (koordinate funkcija) |
| Linija zaglavlja | Počinje sa znakom '>' | Počinje sa znakom '@' | Struktuirani LOCUS blok | Genomske kolone razdvojene tabulatorima |
| Primarna upotreba | Referentni genomi i BLAST pretraga | Sirovi sekvenceri visoke propusnosti (Illumina) | Sveobuhvatni anotirani geni | Anotacije genomskih funkcija |
| Veličina datoteke (ljudska) | ~3 gigabajta nesiromašeno / nekompresovano | ~100+ gigabajta (sa kvalitetima) | Bogati tekst od više gigabajta | ~50 megabajta |
Uobičajeni režimi oštećenja i vodič za heksadecimalni oporavak
Bioinformatički alat prijavljuje grešku 'Invalid sequence character at line X'.
Osnovni uzrok: Razmaci, brojevi ili ne-IUPAC znakovi unutar linija sekvence.
Oporavak: Filtrirajte i očistite znakove sekvence pomoću alata File2File Bioinformatics Tool.
Bezbednosna analiza i vektori napada parsera
Genomski alati parsiraju masivne FASTA datoteke od više gigabajta gde može doći do prekoračenja celobrojnih vrednosti (integer overflow) pri indeksiranju koordinata sekvence.
Poznati vektori napada
- Prekoračenje celobrojnih vrednosti u 32-bitnim indekserima sekvenci (FAI) koji prelaze 2^31 baznih parova.
- Prekoračenje bafera pri čitanju predugačkih zaglavlja identifikatora sekvenci.
- Uskraćivanje usluge (DoS) kroz patološke upite za usklađivanje.
Defanzivne najbolje prakse:
Istorijat i prekretnice
Ključne prednosti
- Neprikosnoveni globalni standard kompjuterske biologije: koristi ga svaki genomski alat, sekvencator i baza podataka na Zemlji.
- Ekstremna jednostavnost: 1. linija počinje sa '>' nakon čega sledi ID, a zatim običan tekst genetskih slova.
- Kapacitet za više sekvenci: jedna datoteka može sadržati hiljade pojedinačnih gena ili kompletne viralne genome.
Tehnička ograničenja i nedostaci
- Ne sadrži ocene kvaliteta sekvenciranja (za razliku od FASTQ-a, koji čuva Phred ocene pouzdanosti po bazi).
- Nema standardizovanu sintaksu metapodataka za linije zaglavlja osim početnog identifikatora.
- Ogroman otisak skladištenja za skupove podataka celog genoma bez Gzip-a ili specijalizovane genomske kompresije.
Zanimljivosti
- Ceo ljudski genom od 3 milijarde baznih parova može se predstaviti u FASTA formatu, zauzimajući otprilike 3 gigabajta prostora za skladištenje.
- Četiri slova DNK uskladištena u FASTA datotekama su A (Adenin), C (Citozin), G (Guanin) i T (Timin).
- Kada je genom koronavirusa COVID-19 prvi put sekvenciran u januaru 2020. godine, naučnici su ga podelili širom sveta kao FASTA datoteku od 30.000 slova.
Često postavljana tehnička pitanja
Šta je FASTA fajl?
FASTA fajl je običan tekstualni fajl koji se koristi u biologiji za skladištenje DNK, RNK ili proteinskih sekvenci koristeći jednoslovne skraćenice.
Koja je razlika između FASTA i FASTQ formata?
FASTA čuva samo slova genetskih sekvenci, dok FASTQ čuva i slova i ocenu tačnosti sekvenciranja za svaku bazu.
Kako mogu da pregledam FASTA fajl?
Možete otvoriti FASTA fajlove u bilo kom uređivaču teksta, pregledati ih u bioinformatičkom softveru kao što su Jalview ili UGENE, ili ih konvertovati pomoću File2File.app.
Povezani parovi konverzije za FASTA
Konverzija obične FASTA sekvence u GenBank ravnu datotekar dodaje esencijalne biološke anotacije i uzorke metapodataka u sirovi genetski kod.
Konverzija GenBank ravne datoteke u FASTA sekvencu uklanja metapodatke anotacija ostavljajući samo sirove nukleotidne ili aminokiselinske sekvence potrebne za brzu bioinformatičku analizu.