Sekvence FASTA (.fasta)

Bioinformatics Standardní

FASTA je všudypřítomný, základní souborový formát bioinformatiky a genomiky, který reprezentuje nukleotidové sekvence (DNA, RNA) a aminokyselinové proteinové sekvence pomocí univerzálních jednopísmenných kódů.

Převést FASTA do GENBANK

Bezplatný konvertor z FASTA do GENBANK v prohlížeči. Převeďte soubory okamžitě ve svém zařízení.

Zkontrolovat a metadata

Operační systémy a analyzátory souborů identifikují soubory FASTA kontrolou počáteční binární sekvence bajtů:

Vyberte nebo přetáhněte soubory sem

100% soukromá konverze v prohlížeči - soubory nikdy neopustí vaše zařízení

nebo vložte Ctrl+V
Záruka ochrany soukromí s nulovým přenosem po síti: 0 bajtů odesláno na externí servery. Veškeré zpracování probíhalo lokálně v sandboxu vašeho prohlížeče.

Podpis hlavičky na úrovni bajtů (Magic Bytes)

Operační systémy a analyzátory souborů identifikují soubory FASTA kontrolou počáteční binární sekvence bajtů:

HEXADECIMÁLNÍ PODPIS (OFFSET 0):

3E

ASCII REPREZENTACE: >

Standardizace: Bioinformatics de facto global standard

Technické specifikace

Architektura kontejneruPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompreseUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Endiantita bajtůASCII / UTF-8 text stream
Barevné prostoryN/A (Genomic Sequence Data)
Kanály a strukturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Max. rozměryUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
PrůhlednostNone
Streamování a progresivní načítáníSequential record-by-record streaming processing

Technická srovnávací matice: FASTA vs konkurence

Technický atributFASTA (Aktuální)FASTQGENBANKGFF
Skóre kvalityŽádné (čistá písmena sekvence)Skóre kvality Phred pro každou báziŽádné (anotace funkcí)Žádné (souřadnice funkcí)
Řádek záhlavíZačíná znakem '>'Začíná znakem '@'Strukturovaný blok LOCUSGenomické sloupce oddělené tabulátory
Primární použitíReferenční genomy a vyhledávání BLASTSurové vysokokapacitní sekvenátory (Illumina)Komplexní anotované genyAnotace genomických prvků
Velikost souboru (lidský)~3 gigabyty nekomprimovaně~100+ gigabajtů (s kvalitami)Vícegigabajtový formát rich text~50 megabajtů

Běžné režimy poškození a příručka pro obnovení v hex

Bioinformatický nástroj hlásí 'Neplatný znak sekvence na řádku X'.

Hlavní příčina: Bílé znaky, čísla nebo znaky jiné než IUPAC uvnitř řádků sekvence.

Obnovení: Filtrovat a vyčistit znaky sekvence pomocí nástroje File2File Bioinformatics Tool.

Bezpečnostní analýza a vektory útoků na parser

Genomické nástroje parsují masivní několikagigabajtové soubory FASTA, kde při indexování souřadnic sekvencí může dojít k přetečení celých čísel (integer overflow).

Známé vektory útoků

  • Přetečení celého čísla u 32bitových indexerů sekvencí (FAI) přesahujících 2^31 párů bází.
  • Přetečení vyrovnávací paměti při čtení nadměrně dlouhých záhlaví identifikátorů sekvencí.
  • Útok odepření služby prostřednictvím patologických dotazů na zarovnání.

Doporučené bezpečnostní postupy:

Historický vývoj a milníky

2003Projekt lidského genomu dokončuje první sekvenování lidského genomu a publikuje výsledky ve formátu FASTA.
1990Nástroj BLAST (Basic Local Alignment Search Tool) přijímá formát FASTA jako svůj standardní vstupní formát.
1985William Pearson a David Lipman představují formát FASTA se softwarem pro zarovnání sekvencí FASTP.

Klíčové výhody a přednosti

  • Nesporný globální standard výpočetní biologie: používá jej každý genomický nástroj, sekvenátor a databáze na Zemi.
  • Extrémní jednoduchost: řádek 1 začíná znakem '>' následovaným ID a prostým textem genetických písmen.
  • Kapacita pro více sekvencí: jediný soubor může obsahovat tisíce jednotlivých genů nebo kompletní virové genomy.

Technická omezení a nevýhody

  • Neobsahuje skóre kvality sekvenování (na rozdíl od formátu FASTQ, který ukládá skóre spolehlivosti Phred pro každou bázi).
  • Žádná standardizovaná syntaxe metadat pro řádky záhlaví kromě úvodního identifikátoru.
  • Obrovská náročnost na úložiště pro celogenomové datové sady bez komprese Gzip nebo specializované genomické komprese.

Zajímavé technické drobnosti

  • Celý lidský genom o 3 miliardách párů bází lze reprezentovat ve formátu FASTA, přičemž zabírá přibližně 3 gigabyty úložiště.
  • Čtyři písmena DNA uložená v souborech FASTA jsou A (Adenin), C (Cytosin), G (Guanin) a T (Thymin).
  • Když byl genom koronaviru COVID-19 poprvé sekvenován v lednu 2020, vědci jej globálně sdíleli jako 30 000 písmen dlouhý soubor FASTA.

Často kladené technické otázky

Co je to soubor FASTA?

Soubor FASTA je prostý textový soubor používaný v biologii k ukládání sekvencí DNA, RNA nebo proteinů pomocí jednopísmenných zkratek.

Jaký je rozdíl mezi formáty FASTA a FASTQ?

FASTA ukládá pouze písmena genetické sekvence, zatímco FASTQ ukládá jak písmena, tak skóre kvality přesnosti sekvenování pro každou bázi.

Jak mohu zobrazit soubor FASTA?

Soubory FASTA můžete otevřít v libovolném textovém editoru, zobrazit si je v bioinformatickém softwaru, jako je Jalview nebo UGENE, případně je převést pomocí File2File.app.