GenBank Flatfile (.gb)

NCBI Standardní

Plochý soubor NCBI GenBank (.gb / .gbk) je zlatým standardem pro formát genomových anotací, který spravuje National Institutes of Health (NIH). Kombinuje kompletní DNA sekvence s podrobnými pozicemi genů, kódujícími oblastmi a citacemi vědecké literatury.

Převést FASTA do GENBANK

Bezplatný konvertor z FASTA do GENBANK v prohlížeči. Převeďte soubory okamžitě ve svém zařízení.

Zkontrolovat a metadata

Operační systémy a analyzátory souborů identifikují soubory GenBank kontrolou počáteční binární sekvence bajtů:

Vyberte nebo přetáhněte soubory sem

100% soukromá konverze v prohlížeči - soubory nikdy neopustí vaše zařízení

nebo vložte Ctrl+V
Záruka ochrany soukromí s nulovým přenosem po síti: 0 bajtů odesláno na externí servery. Veškeré zpracování probíhalo lokálně v sandboxu vašeho prohlížeče.

Podpis hlavičky na úrovni bajtů (Magic Bytes)

Operační systémy a analyzátory souborů identifikují soubory GenBank kontrolou počáteční binární sekvence bajtů:

HEXADECIMÁLNÍ PODPIS (OFFSET 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII REPREZENTACE: LOCUS

Standardizace: NCBI GenBank Release Specification

Technické specifikace

Architektura kontejneruPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
KompreseUncompressed text (often compressed with Gzip as .gb.gz)
Endiantita bajtůUTF-8 / ASCII text stream
Barevné prostoryN/A (Genomic Annotation Database)
Kanály a strukturaDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Max. rozměryUnbounded sequence and feature count
PrůhlednostNone
Streamování a progresivní načítáníRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Technická srovnávací matice: GenBank vs konkurence

Technický atributGenBank (Aktuální)FASTAGFFFASTQ
Detail anotaceVyčerpávající (geny, CDS, citace, translace)Žádný (pouze sekvence)Tabulkové genomové souřadnicePouze skóre kvality sekvenování
Zahrnutá sekvenceAno (v bloku ORIGIN na konci)Ano (čistá sekvence)Ne (pouze souřadnice)Ano (surová čtení)
Primární nástrojeNCBI, SnapGene, BenchlingBLAST, nástroje pro zarovnáníGenomové prohlížeče (UCSC, IGV)Illumina sekvenátory
Ukončení záznamu// na samostatném řádkuDalší řádek hlavičky '>'Konec souboruDalší řádek '@'

Běžné režimy poškození a příručka pro obnovení v hex

Bioinformatický software hlásí 'Chyba parseru GenBank: předčasné EOF před //'.

Hlavní příčina: Oříznuté stahování, které uřízlo konečný blok původu sekvence nebo oddělovač '//'.

Obnovení: Připojte '//\n' na konec souboru pomocí nástroje File2File Bioinformatics Tool.

Bezpečnostní analýza a vektory útoků na parser

Parsery GenBank zpracovávají komplexní řetězce umístění funkcí, kde zpětné sledování regulárních výrazů může spustit odepření služby.

Známé vektory útoků

  • Odepření služby regulárních výrazů (ReDoS) v komplexních parserech umístění funkcí.
  • Přetečení vyrovnávací paměti při čtení nadměrně dlouhých názvů referencí citací.
  • Odepření služby prostřednictvím smyček odkazů na cirkulární funkce.

Doporučené bezpečnostní postupy:

Historický vývoj a milníky

2023Databáze GenBank překonala 2,5 miliardy nukleotidových sekvencí a 3 biliony páru bází.
1992NCBI přebírá plnou správu GenBank od Los Alamos National Laboratory.
1982Založeno Walterem Goadem v Los Alamos National Laboratory za finanční podpory NIH.

Klíčové výhody a přednosti

  • Bohatá a komplexní metadata: ukládá hranice genů, pozice promotorů, exony, introny a přeložené proteinové sekvence.
  • Zahrnuje kompletní odkazy na vědeckou literaturu, ID PubMed, jména autorů a data odevzdání experimentů.
  • Univerzální výměnný formát pro syntetickou biologii, návrh plazmidů (SnapGene) a odevzdávání do databáze NCBI.

Technická omezení a nevýhody

  • Výrazně ukecanější a větší velikosti souborů než prosté sekvence FASTA.
  • Parsování souřadnic tabulky funkcí ('join(complement(100..500),600..800)') vyžaduje komplexní logiku parseru.
  • Není navrženo pro zarovnání masivních vysoce propustných sekvenačních čtení.

Zajímavé technické drobnosti

  • Každý záznam GenBank začíná slovem 'LOCUS' a končí dvěma lomítky '//' na samostatném řádku.
  • GenBank denně synchronizuje svá data s Evropskou laboratoří molekulární biologie (EMBL) a Japonskou databází DNA (DDBJ).
  • Syntetičtí biologové používají soubory GenBank k navrhování vlastních cirkulárních plazmidů pro úpravu genů CRISPR a produkci inzulínu.

Často kladené technické otázky

Jaký je rozdíl mezi formátem FASTA a GenBank?

FASTA obsahuje pouze surovou sekvenci DNA s krátkým záhlavím. GenBank obsahuje surovou sekvenci NAVÍC se všemi anotacemi genů, překlady proteinů, autory a vědeckými poznámkami.

Jak mohu převést GenBank (.gb) na FASTA?

Pomocí File2File.app přímo ve svém prohlížeči můžete jedním kliknutím převést soubory GenBank na čisté nukleotidové nebo proteinové sekvence FASTA.

Jaký software otevírá soubory GenBank?

K prohlížení a úpravám souborů GenBank lze použít software SnapGene, Benchling, UGENE, Artemis a File2File.app.