File GenBank (.gb)

NCBI Standard

NCBI GenBank Flat File (.gb / .gbk) è il formato di annotazione genomica di riferimento gestito dai National Institutes of Health (NIH), che combina sequenze di DNA complete con posizioni geniche dettagliate, regioni codificanti e citazioni della letteratura scientifica.

Converti da FASTA a GENBANK

Convertitore gratuito da FASTA a GENBANK nel browser. Converti i file istantaneamente sul tuo dispositivo.

Ispeziona e metadati

I sistemi operativi e gli analizzatori di file identificano i file GenBank ispezionando la sequenza di byte binari iniziale:

Seleziona o rilascia i file qui

Conversione 100% privata nel browser: i file non lasciano mai il tuo dispositivo

o incolla Ctrl+V
Garanzia di privacy con zero trasmissioni di rete: 0 byte caricati su server esterni. Tutta l'elaborazione è avvenuta localmente nella sandbox del tuo browser.

Firma dell'intestazione a livello di byte (Magic Bytes)

I sistemi operativi e gli analizzatori di file identificano i file GenBank ispezionando la sequenza di byte binari iniziale:

FIRMA ESADECIMALE (OFFSET 0):

4C 4F 43 55 53 20 20 20 20 20

RAPPRESENTAZIONE ASCII: LOCUS

Standardizzazione: NCBI GenBank Release Specification

Specifiche tecniche

Architettura del containerPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
CompressioneUncompressed text (often compressed with Gzip as .gb.gz)
Endianness dei byteUTF-8 / ASCII text stream
Spazi coloreN/A (Genomic Annotation Database)
Canali e strutturaDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Dimensioni massimeUnbounded sequence and feature count
TrasparenzaNone
Streaming e progressivoRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Matrice di confronto tecnico: GenBank vs Concorrenti

Attributo tecnicoGenBank (Corrente)FASTAGFFFASTQ
Dettaglio dell'AnnotazioneEsaustivo (geni, CDS, citazioni, traduzione)Nessuno (solo sequenza)Coordinate genomiche tabulariSolo punteggi di qualità del sequenziamento
Sequenza InclusaSì (nel blocco ORIGIN alla fine)Sì (sequenza pura)No (solo coordinate)Sì (letture grezze)
Strumenti PrincipaliNCBI, SnapGene, BenchlingBLAST, strumenti di allineamentoBrowser genomici (UCSC, IGV)Sequenziatori Illumina
Terminatore di Record// su una riga indipendenteLinea di intestazione successiva '>'Fine del fileLinea successiva '@'

Modalità di corruzione comuni e guida al recupero Hex

Il software di bioinformatica segnala 'GenBank parser error: premature EOF before //' (Errore del parser GenBank: fine file prematura prima di //).

Causa principale: Download troncato che ha tagliato il blocco di origine della sequenza finale o il delimitatore '//'.

Ripristino: Aggiungere '//\n' alla fine del file utilizzando lo strumento di bioinformatica di File2File.

Analisi di sicurezza e vettori di attacco del parser

I parser GenBank elaborano stringhe complesse di posizione delle caratteristiche in cui il backtracking delle espressioni regolari può innescare un denial of service.

Vettori di attacco noti

  • Denial of service basato su espressioni regolari (ReDoS) in parser complessi di posizioni delle caratteristiche.
  • Buffer overflow durante la lettura di titoli di riferimento di citazioni eccessivamente lunghi.
  • Denial of service tramite cicli di riferimento di caratteristiche circolari.

Migliori pratiche difensive:

Origini storiche e tappe fondamentali

2023Il database GenBank supera i 2,5 miliardi di sequenze nucleotidiche e i 3 trilioni di paia di basi.
1992L'NCBI assume la gestione completa di GenBank dal Laboratorio Nazionale di Los Alamos.
1982Creato da Walter Goad presso il Laboratorio Nazionale di Los Alamos grazie ai finanziamenti del NIH.

Vantaggi principali e pro

  • Metadati completi e ricchi: memorizza i confini dei geni, le posizioni dei promotori, gli esoni, gli introni e le sequenze proteiche tradotte.
  • Include riferimenti completi alla letteratura scientifica, ID PubMed, nomi degli autori e date di invio sperimentale.
  • Formato di interscambio universale per la biologia sintetica, la progettazione di plasmidi (SnapGene) e gli invii al database NCBI.

Limiti tecnici e svantaggi

  • Dimensioni dei file significativamente più prolisse e grandi rispetto alle semplici sequenze FASTA.
  • L'analisi delle coordinate della tabella delle caratteristiche ('join(complement(100..500),600..800)') richiede una logica di parsing complessa.
  • Non progettato per l'allineamento massiccio di letture di sequenziamento ad alto rendimento (high-throughput).

Curiosità tecniche interessanti

  • Ogni voce di GenBank inizia con la parola 'LOCUS' e si conclude con due barre rovesciate '//' su una riga a sé stante.
  • GenBank sincronizza quotidianamente i suoi dati con il Laboratorio Europeo di Biologia Molecolare (EMBL) e il DNA Data Bank of Japan (DDBJ).
  • I biologi sintetici utilizzano i file GenBank per progettare plasmidi circolari personalizzati per l'editing genetico CRISPR e la produzione di insulina.

Domande tecniche frequenti

Qual è la differenza tra il formato FASTA e GenBank?

FASTA contiene solo la sequenza di DNA grezza con una breve riga di intestazione. GenBank contiene la sequenza grezza PIÙ tutte le annotazioni geniche, le traduzioni proteiche, gli autori e le note scientifiche.

Come posso convertire GenBank (.gb) in FASTA?

Puoi convertire i file GenBank in sequenze nucleotidiche o proteiche FASTA pulite con un solo clic utilizzando File2File.app direttamente nel tuo browser.

Quale software apre i file GenBank?

SnapGene, Benchling, UGENE, Artemis e File2File.app possono visualizzare e modificare i file GenBank.