Sekvence FASTA (.fasta)
Bioinformatics StandardníFASTA je všudypřítomný, základní souborový formát bioinformatiky a genomiky, který reprezentuje nukleotidové sekvence (DNA, RNA) a aminokyselinové proteinové sekvence pomocí univerzálních jednopísmenných kódů.
Převést FASTA do GENBANK
Bezplatný konvertor z FASTA do GENBANK v prohlížeči. Převeďte soubory okamžitě ve svém zařízení.
Zkontrolovat a metadata
Operační systémy a analyzátory souborů identifikují soubory FASTA kontrolou počáteční binární sekvence bajtů:
Podpis hlavičky na úrovni bajtů (Magic Bytes)
Operační systémy a analyzátory souborů identifikují soubory FASTA kontrolou počáteční binární sekvence bajtů:
HEXADECIMÁLNÍ PODPIS (OFFSET 0):
3EASCII REPREZENTACE: >
Standardizace: Bioinformatics de facto global standard
Technické specifikace
| Architektura kontejneru | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Komprese | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Endiantita bajtů | ASCII / UTF-8 text stream |
| Barevné prostory | N/A (Genomic Sequence Data) |
| Kanály a struktura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Max. rozměry | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Průhlednost | None |
| Streamování a progresivní načítání | Sequential record-by-record streaming processing |
Technická srovnávací matice: FASTA vs konkurence
| Technický atribut | FASTA (Aktuální) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Skóre kvality | Žádné (čistá písmena sekvence) | Skóre kvality Phred pro každou bázi | Žádné (anotace funkcí) | Žádné (souřadnice funkcí) |
| Řádek záhlaví | Začíná znakem '>' | Začíná znakem '@' | Strukturovaný blok LOCUS | Genomické sloupce oddělené tabulátory |
| Primární použití | Referenční genomy a vyhledávání BLAST | Surové vysokokapacitní sekvenátory (Illumina) | Komplexní anotované geny | Anotace genomických prvků |
| Velikost souboru (lidský) | ~3 gigabyty nekomprimovaně | ~100+ gigabajtů (s kvalitami) | Vícegigabajtový formát rich text | ~50 megabajtů |
Běžné režimy poškození a příručka pro obnovení v hex
Bioinformatický nástroj hlásí 'Neplatný znak sekvence na řádku X'.
Hlavní příčina: Bílé znaky, čísla nebo znaky jiné než IUPAC uvnitř řádků sekvence.
Obnovení: Filtrovat a vyčistit znaky sekvence pomocí nástroje File2File Bioinformatics Tool.
Bezpečnostní analýza a vektory útoků na parser
Genomické nástroje parsují masivní několikagigabajtové soubory FASTA, kde při indexování souřadnic sekvencí může dojít k přetečení celých čísel (integer overflow).
Známé vektory útoků
- Přetečení celého čísla u 32bitových indexerů sekvencí (FAI) přesahujících 2^31 párů bází.
- Přetečení vyrovnávací paměti při čtení nadměrně dlouhých záhlaví identifikátorů sekvencí.
- Útok odepření služby prostřednictvím patologických dotazů na zarovnání.
Doporučené bezpečnostní postupy:
Historický vývoj a milníky
Klíčové výhody a přednosti
- Nesporný globální standard výpočetní biologie: používá jej každý genomický nástroj, sekvenátor a databáze na Zemi.
- Extrémní jednoduchost: řádek 1 začíná znakem '>' následovaným ID a prostým textem genetických písmen.
- Kapacita pro více sekvencí: jediný soubor může obsahovat tisíce jednotlivých genů nebo kompletní virové genomy.
Technická omezení a nevýhody
- Neobsahuje skóre kvality sekvenování (na rozdíl od formátu FASTQ, který ukládá skóre spolehlivosti Phred pro každou bázi).
- Žádná standardizovaná syntaxe metadat pro řádky záhlaví kromě úvodního identifikátoru.
- Obrovská náročnost na úložiště pro celogenomové datové sady bez komprese Gzip nebo specializované genomické komprese.
Zajímavé technické drobnosti
- Celý lidský genom o 3 miliardách párů bází lze reprezentovat ve formátu FASTA, přičemž zabírá přibližně 3 gigabyty úložiště.
- Čtyři písmena DNA uložená v souborech FASTA jsou A (Adenin), C (Cytosin), G (Guanin) a T (Thymin).
- Když byl genom koronaviru COVID-19 poprvé sekvenován v lednu 2020, vědci jej globálně sdíleli jako 30 000 písmen dlouhý soubor FASTA.
Často kladené technické otázky
Co je to soubor FASTA?
Soubor FASTA je prostý textový soubor používaný v biologii k ukládání sekvencí DNA, RNA nebo proteinů pomocí jednopísmenných zkratek.
Jaký je rozdíl mezi formáty FASTA a FASTQ?
FASTA ukládá pouze písmena genetické sekvence, zatímco FASTQ ukládá jak písmena, tak skóre kvality přesnosti sekvenování pro každou bázi.
Jak mohu zobrazit soubor FASTA?
Soubory FASTA můžete otevřít v libovolném textovém editoru, zobrazit si je v bioinformatickém softwaru, jako je Jalview nebo UGENE, případně je převést pomocí File2File.app.
Související konverzní páry pro FASTA
Převedení obyčejné sekvence FASTA na plochý soubor GenBank přidává k surovému genetickému kódu nezbytné biologické anotace a metadata.
Převedení plochého souboru GenBank na sekvenci FASTA odstraní metadata anotací a ponechá pouze surové sekvence nukleotidů nebo aminokyselin potřebné pro rychlou bioinformatickou analýzu.