GenBank súbor (.gb)

NCBI Štandard

Plochý súbor NCBI GenBank (.gb / .gbk) je zlatým štandardom pre genomickú anotáciu, ktorý spravuje Národný inštitút zdravia (NIH) a ktorý kombinuje kompletné DNA sekvencie s podrobnými lokalizáciami génov, kódujúcimi regiónmi a citáciami vedeckej literatúry.

Konvertovať FASTA do GENBANK

Bezplatný konvertor z FASTA do GENBANK priamo v prehliadači. Konvertujte súbory okamžite vo svojom zariadení.

Preskúmať a metadáta

Operačné systémy a analyzátory súborov identifikujú súbory GenBank kontrolou počiatočnej binárnej bajtovej sekvencie:

Vyberte alebo presuňte súbory sem

100 % súkromná konverzia v prehliadači - súbory nikdy neopustia vaše zariadenie

alebo prilepiť Ctrl+V
Záruka súkromia s nulovým prenosom do siete: 0 bajtov odovzdaných na externé servery. Všetko spracovanie prebehlo lokálne v pieskovisku vášho prehliadača.

Podpis hlavičky na úrovni bajtov (Magic Bytes)

Operačné systémy a analyzátory súborov identifikujú súbory GenBank kontrolou počiatočnej binárnej bajtovej sekvencie:

HEXADECIMÁLNY PODPIS (OFFSET 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII REPREZENTÁCIA: LOCUS

Štandardizácia: NCBI GenBank Release Specification

Technické špecifikácie

Architektúra kontajneraPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
KompresiaUncompressed text (often compressed with Gzip as .gb.gz)
Poradie bajtov (Endianness)UTF-8 / ASCII text stream
Farebné priestoryN/A (Genomic Annotation Database)
Kanály a štruktúraDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Max. rozmeryUnbounded sequence and feature count
PriehľadnosťNone
Streamovanie a postupné načítavanieRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Technická porovnávacia matica: GenBank vs konkurenti

Technický atribútGenBank (Aktuálne)FASTAGFFFASTQ
Detail anotácieVyčerpávajúci (gény, CDS, citácie, preklad)Žiadne (iba sekvencia)Tabuľkové genomické súradniceIba skóre kvality sekvenovania
Zahrnutá sekvenciaÁno (v bloku ORIGIN na konci)Áno (čistá sekvencia)Nie (iba súradnice)Áno (surové čítania)
Hlavné nástrojeNCBI, SnapGene, BenchlingBLAST, zarovnávacie nástrojePrehliadače genómov (UCSC, IGV)Sekvenátory Illumina
Ukončenie záznamu// na samostatnom riadkuĎalší riadok hlavičky „>"Koniec súboruĎalší riadok „@"

Bežné režimy poškodenia a príručka na obnovu v hexadecimálnom kóde

Bioinformatický softvér hlási „GenBank parser error: premature EOF before //".

Hlavná príčina: Skrátené sťahovanie, ktoré odseklo koncový blok pôvodu sekvencie alebo oddeľovač „//".

Obnova: Pridajte „//\n" na koniec súboru pomocou nástroja File2File Bioinformatics Tool.

Bezpečnostná analýza a vektory útokov na parser

Parsery formátu GenBank spracúvajú zložité reťazce lokalizácie funkcií, kde spätné sledovanie regulárnych výrazov môže vyvolať odopretie služby.

Známe vektory útokov

  • Odopretie služby prostredníctvom regulárnych výrazov (ReDoS) v parseroch zložitých lokalizácií funkcií.
  • Pretečenie vyrovnávacej pamäte pri čítaní nadmerne dlhých názvov citovaných referencií.
  • Odopretie služby prostredníctvom slučiek odkazov na cyklické funkcie.

Najlepšie obranné postupy:

Historický pôvod a míľniky

2023Databáza GenBank prekračuje 2,5 miliardy nukleotidových sekvencií a 3 bilióny párov báz.
1992NCBI preberá plnú správu databázy GenBank od Národného laboratória v Los Alamos.
1982Založené Walterom Goadom v Národnom laboratóriu v Los Alamos s financovaním od NIH.

Kľúčové výhody a prednosti

  • Bohaté komplexné metadáta: ukladá hranice génov, polohy promótorov, exóny, intróny a preložené proteínové sekvencie.
  • Obsahuje kompletné odkazy na vedeckú literatúru, identifikačné čísla PubMed, mená autorov a dátumy predloženia experimentov.
  • Univerzálny výmenný formát pre syntetickú biológiu, dizajn plazmidov (SnapGene) a podávania do databázy NCBI.

Technické obmedzenia a nevýhody

  • Výrazne ukecanejšie a väčšie veľkosti súborov ako čisté sekvencie FASTA.
  • Parsovanie súradníc tabuľky funkcií („join(complement(100..500),600..800)") vyžaduje zložitú logiku parsera.
  • Nie je navrhnuté na zarovnávanie masívnych vysokorýchlostných sekvenačných čítaní.

Zaujímavé technické drobnosti

  • Každý záznam v GenBank začína slovom „LOCUS" a končí dvoma dopredu lomenými čiarami „//" na samostatnom riadku.
  • GenBank denne synchronizuje svoje dáta s Európskym laboratóriom molekulárnej biológie (EMBL) a Japonskou databázou DNA (DDBJ).
  • Syntetickí biológovia používajú súbory GenBank na navrhovanie vlastných cirkulárnych plazmidov pre úpravu génov systémom CRISPR a produkciu inzulínu.

Často kladené technické otázky

Aký je rozdiel medzi formátom FASTA a GenBank?

FASTA obsahuje iba surovú sekvenciu DNA so stručným hlavičkovým riadkom. GenBank obsahuje surovú sekvenciu PLUS všetky anotácie génov, preklady proteínov, autorov a vedecké poznámky.

Ako môžem skonvertovať súbor GenBank (.gb) na FASTA?

Pomocou služby File2File.app priamo vo vašom prehliadači môžete jedným kliknutím skonvertovať súbory GenBank na čisté nukleotidové alebo proteínové sekvencie FASTA.

Aký softvér otvára súbory GenBank?

Súbory GenBank dokáže prezerať a upravovať softvér SnapGene, Benchling, UGENE, Artemis a File2File.app.