File GenBank (.gb)
NCBI StandardNCBI GenBank Flat File (.gb / .gbk) è il formato di annotazione genomica di riferimento gestito dai National Institutes of Health (NIH), che combina sequenze di DNA complete con posizioni geniche dettagliate, regioni codificanti e citazioni della letteratura scientifica.
Converti da FASTA a GENBANK
Convertitore gratuito da FASTA a GENBANK nel browser. Converti i file istantaneamente sul tuo dispositivo.
Ispeziona e metadati
I sistemi operativi e gli analizzatori di file identificano i file GenBank ispezionando la sequenza di byte binari iniziale:
Firma dell'intestazione a livello di byte (Magic Bytes)
I sistemi operativi e gli analizzatori di file identificano i file GenBank ispezionando la sequenza di byte binari iniziale:
FIRMA ESADECIMALE (OFFSET 0):
4C 4F 43 55 53 20 20 20 20 20RAPPRESENTAZIONE ASCII: LOCUS
Standardizzazione: NCBI GenBank Release Specification
Specifiche tecniche
| Architettura del container | Plaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//' |
| Compressione | Uncompressed text (often compressed with Gzip as .gb.gz) |
| Endianness dei byte | UTF-8 / ASCII text stream |
| Spazi colore | N/A (Genomic Annotation Database) |
| Canali e struttura | DNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations |
| Dimensioni massime | Unbounded sequence and feature count |
| Trasparenza | None |
| Streaming e progressivo | Record-by-record streaming: individual GenBank entries are delimited by '//' lines |
Matrice di confronto tecnico: GenBank vs Concorrenti
| Attributo tecnico | GenBank (Corrente) | FASTA | GFF | FASTQ |
|---|---|---|---|---|
| Dettaglio dell'Annotazione | Esaustivo (geni, CDS, citazioni, traduzione) | Nessuno (solo sequenza) | Coordinate genomiche tabulari | Solo punteggi di qualità del sequenziamento |
| Sequenza Inclusa | Sì (nel blocco ORIGIN alla fine) | Sì (sequenza pura) | No (solo coordinate) | Sì (letture grezze) |
| Strumenti Principali | NCBI, SnapGene, Benchling | BLAST, strumenti di allineamento | Browser genomici (UCSC, IGV) | Sequenziatori Illumina |
| Terminatore di Record | // su una riga indipendente | Linea di intestazione successiva '>' | Fine del file | Linea successiva '@' |
Modalità di corruzione comuni e guida al recupero Hex
Il software di bioinformatica segnala 'GenBank parser error: premature EOF before //' (Errore del parser GenBank: fine file prematura prima di //).
Causa principale: Download troncato che ha tagliato il blocco di origine della sequenza finale o il delimitatore '//'.
Ripristino: Aggiungere '//\n' alla fine del file utilizzando lo strumento di bioinformatica di File2File.
Analisi di sicurezza e vettori di attacco del parser
I parser GenBank elaborano stringhe complesse di posizione delle caratteristiche in cui il backtracking delle espressioni regolari può innescare un denial of service.
Vettori di attacco noti
- Denial of service basato su espressioni regolari (ReDoS) in parser complessi di posizioni delle caratteristiche.
- Buffer overflow durante la lettura di titoli di riferimento di citazioni eccessivamente lunghi.
- Denial of service tramite cicli di riferimento di caratteristiche circolari.
Migliori pratiche difensive:
Origini storiche e tappe fondamentali
Vantaggi principali e pro
- Metadati completi e ricchi: memorizza i confini dei geni, le posizioni dei promotori, gli esoni, gli introni e le sequenze proteiche tradotte.
- Include riferimenti completi alla letteratura scientifica, ID PubMed, nomi degli autori e date di invio sperimentale.
- Formato di interscambio universale per la biologia sintetica, la progettazione di plasmidi (SnapGene) e gli invii al database NCBI.
Limiti tecnici e svantaggi
- Dimensioni dei file significativamente più prolisse e grandi rispetto alle semplici sequenze FASTA.
- L'analisi delle coordinate della tabella delle caratteristiche ('join(complement(100..500),600..800)') richiede una logica di parsing complessa.
- Non progettato per l'allineamento massiccio di letture di sequenziamento ad alto rendimento (high-throughput).
Curiosità tecniche interessanti
- Ogni voce di GenBank inizia con la parola 'LOCUS' e si conclude con due barre rovesciate '//' su una riga a sé stante.
- GenBank sincronizza quotidianamente i suoi dati con il Laboratorio Europeo di Biologia Molecolare (EMBL) e il DNA Data Bank of Japan (DDBJ).
- I biologi sintetici utilizzano i file GenBank per progettare plasmidi circolari personalizzati per l'editing genetico CRISPR e la produzione di insulina.
Domande tecniche frequenti
Qual è la differenza tra il formato FASTA e GenBank?
FASTA contiene solo la sequenza di DNA grezza con una breve riga di intestazione. GenBank contiene la sequenza grezza PIÙ tutte le annotazioni geniche, le traduzioni proteiche, gli autori e le note scientifiche.
Come posso convertire GenBank (.gb) in FASTA?
Puoi convertire i file GenBank in sequenze nucleotidiche o proteiche FASTA pulite con un solo clic utilizzando File2File.app direttamente nel tuo browser.
Quale software apre i file GenBank?
SnapGene, Benchling, UGENE, Artemis e File2File.app possono visualizzare e modificare i file GenBank.
Coppie di conversione per GenBank correlate
La conversione di una sequenza FASTA semplice in un flatfile GenBank aggiunge annotazioni biologiche essenziali e metadati al codice genetico grezzo.
La conversione di un flatfile GenBank in una sequenza FASTA rimuove i metadati di annotazione per lasciare solo le sequenze grezze di nucleotidi o amminoacidi necessarie per una rapida analisi bioinformatica.