Konvertor sekvencí FASTA na soubor GenBank

Převedení obyčejné sekvence FASTA na plochý soubor GenBank přidává k surovému genetickému kódu nezbytné biologické anotace a metadata.

Vyberte nebo přetáhněte soubory

Vyberte nebo přetáhněte soubory sem

100% soukromá konverze v prohlížeči - soubory nikdy neopustí vaše zařízení

nebo vložte Ctrl+V
Záruka ochrany soukromí s nulovým přenosem po síti: 0 bajtů odesláno na externí servery. Veškeré zpracování probíhalo lokálně v sandboxu vašeho prohlížeče.

Porovnání formátů a technické specifikace

SpecifikaceFASTAGENBANK
MIME typtext/plaintext/plain
Typbioinformatics sequence textannotated nucleotide flatfile
Kompresenone (plain text)none (plain text)
Standardní specifikaceNCBI FASTA SpecificationNCBI GenBank Flatfile Release Notes
Hlavička souboru (Magic bytes)3E ('>' Sequence header line)4C 4F 43 55 53 20 20 20 20 (LOCUS )

Přehled formátu a použití

Výzkumníci v oblasti genomiky často přecházejí mezi jednoduchým textem sekvencí a podrobně anotovanými záznamy. Soubor FASTA poskytuje lehký kontejner obsahující pouze řádek hlavičky začínající znakem větší než a surová písmena nukleotidů nebo aminokyselin. Tato jednoduchost je skvělá pro základní nástroje zarovnání a vyhledávání sekvencí. Pokud však vědci potřebují publikovat nové genomy nebo studovat specifické genové funkce, vyžadují strukturovaná metadata. Formát GenBank toto řeší zabalením genetické sekvence do pevného víceřádkového textového dokumentu. Obsahuje strukturované sekvence pro názvy lokusů, taxonomii organismů, publikační reference a tabulky vlastností, které přesně určují, kde se na chromozomu nacházejí geny, kódovací oblasti a promotory. Bioinformatické kanály, prohlížeče genomu a odesílací portály, jako je NCBI GenBank, spoléhají na tuto bohatou strukturu anotací, aby porozuměly surové DNA. Provedení této konverze překlenuje propast mezi objevem surové sekvence a formálním biologickým popisem. Zatímco soubor FASTA jednoduše udává, jaká písmena jsou v DNA přítomna, cílový soubor GenBank vysvětluje, co tato písmena uvnitř živé buňky skutečně dělají.

Technické specifikace a přehled kodeků

Oba formáty používají nestlačený prostý text s typem MIME text/plain, což znamená, že ani jeden formát se spoléhá na binární podpisy magických bajtů nebo proprietární hlavičky. Místo toho závisí na pravidlech strukturovaného parsování. Soubory FASTA používají text ASCII začínající znakem '>' pro hlavičku a standardní jednopísmenné kódy pro nukleotidy (A, C, G, T, N). Soubory GenBank používají přísnou řádkovou architekturu začínající klíčovým slovem 'LOCUS' a končící terminátorem '//'. Konverzní nástroje musí číst surová řetězcová data ze vstupu FASTA, mapovat sekvenci do standardního bloku ORIGIN v GenBank a vkládat uživatelem dodané nebo předpovězené anotační bloky do sekce FEATURES. Protože oba soubory jsou prostým textem, konverze je zcela bezztrátová ohledně primárních dat sekvence, ačkoliv anotace musí být přidány manuálně nebo výpočetně předpovězeny, protože FASTA postrádá strukturovaná metadata.

Kompatibilita s operačními systémy a prohlížeči

Jelikož jsou oba formáty standardním textem ASCII, těší se univerzální kompatibilitě napříč všemi moderními operačními systémy a hardwarovými platformami. Můžete je otevírat a upravovat v systémech Windows, macOS a Linux pomocí základních textových editorů nebo specializovaných bioinformatických balíčků, jako jsou Geneious, SnapGene a Artemis. Webové prohlížeče dokážou vykreslit oba typy souborů nativně uvnitř textových oblastí nebo prostřednictvím prohlížečů sekvencí založených na JavaScriptu. Nástroje příkazové řádky, jako jsou Biopython, EMBOSS a NCBI BLAST, tyto soubory hladce parsují napříč desktopovými terminály, vysoce výkonnými výpočetními clustery a cloumovými prostředími.

💡 Užitečné informace

Před konverzí vždy ověřte abecedu své sekvence, protože přimíchání kódů aminokyselin do nukleotidového záznamu GenBank způsobí, že analyzátory pro odesílání do NCBI výstup odmítnou.

Porovnání formátů a technické specifikace

Typický soubor bakteriálního chromozomu o velikosti 5 megabajtů ve formátu FASTA naroste zhruba na 15 megabajtů při rozšíření do plně anotovaného souboru GenBank kvůli přidaným tabulkám vlastností a popisnému textu. Na standardním mobilním připojení 4G rychlostí 30 megabitů za sekundu se tento 15megabajtový soubor přenese za asi 4 sekundy. V síti 5G běžící rychlostí 150 megabitů za sekundu se přenos sníží pod 1 sekundu. Přes moderní optické připojení o rychlosti 1 gigabit za sekundu se soubor přesune okamžitě za zlomek sekundy.

Často kladené otázky

Jak převést sekvenci FASTA na plochý soubor GenBank bez ztráty kvality?

Konverze je pro podkladovou genetickou sekvenci zcela bezztrátová, protože oba formáty ukládají naprosto stejná písmena nukleotidů nebo proteinů. Vzhledem k tomu, že soubory FASTA neobsahují biologické anotace, bude však každý převedený soubor GenBank vyžadovat buď automatickou predikci genů, nebo manuální anotaci pro správné vyplnění tabulek vlastností.

Jaký je rozdíl mezi sekvencí FASTA a plochým souborem GenBank?

Soubor FASTA je minimalistický textový formát obsahující pouze jednoduchý řádek hlavičky a řetězce surových sekvencí. Plochý soubor GenBank je vysoce strukturovaný dokument rozdělený do definovaných sekcí, jako jsou LOCUS, DEFINITION, ACCESSION, SOURCE, FEATURES a ORIGIN, aby vedle sekvence uchovával bohatá biologická metadata.