GenBank-Flatfile (.gb)

NCBI Standard

Die NCBI GenBank Flat File (.gb / .gbk) ist das Goldstandard-Format für Genomannotationen, gepflegt von den National Institutes of Health (NIH), und kombiniert vollständige DNA-Sequenzen mit detaillierten Genpositionen, kodierenden Regionen und Zitaten wissenschaftlicher Literatur.

Von FASTA zu GENBANK konvertieren

Kostenloser Konverter von FASTA zu GENBANK im Browser. Konvertieren Sie Dateien sofort auf Ihrem Gerät.

Untersuchen & Metadaten

Betriebssysteme und Dateianalysatoren identifizieren GenBank-Dateien durch Untersuchung der führenden binären Byte-Sequenz:

Dateien auswählen oder hierher ziehen

100 % private Konvertierung im Browser - Dateien verlassen niemals Ihr Gerät

oder einfügen Strg+V
Datenschutzgarantie ohne Netzwerkübertragung: 0 Bytes an externe Server hochgeladen. Die gesamte Verarbeitung erfolgt lokal in Ihrer Browser-Sandbox.

Byte-basierte Headersignatur (Magic Bytes)

Betriebssysteme und Dateianalysatoren identifizieren GenBank-Dateien durch Untersuchung der führenden binären Byte-Sequenz:

HEX-SIGNATUR (OFFSET 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII-DARSTELLUNG: LOCUS

Standardisierung: NCBI GenBank Release Specification

Technische Daten

Container-ArchitekturPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
KompressionUncompressed text (often compressed with Gzip as .gb.gz)
Byte-EndiannessUTF-8 / ASCII text stream
FarbräumeN/A (Genomic Annotation Database)
Kanäle & StrukturDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Max. AbmessungenUnbounded sequence and feature count
TransparenzNone
Streaming & ProgressivRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Technischer Vergleich: GenBank im Vergleich zu Wettbewerbern

Technisches AttributGenBank (Aktuell)FASTAGFFFASTQ
AnnahmedetailErschöpfend (Gen, CDS, Zitationen, Translation)Keine (nur Sequenz)Tabellarische GenomkoordinatenNur Sequenzierungsqualitätswerte
Enthaltene SequenzJa (im ORIGIN-Block am Ende)Ja (reine Sequenz)Nein (nur Koordinaten)Ja (Roh-Reads)
Primäre WerkzeugeNCBI, SnapGene, BenchlingBLAST, Alignment-ToolsGenom-Browser (UCSC, IGV)Illumina-Sequenzierer
Datensatz-Terminator// in eigener ZeileNächste '>' KopfzeileDateiendeNächste '@' Zeile

Häufige Korruptionsarten & Hex-Wiederherstellungsleitfaden

Bioinformatik-Software meldet 'GenBank-Parser-Fehler: vorzeitiges Dateiende vor //'.

Ursache: Ein abgebrochener Download, der den letzten Sequenz-Origin-Block oder das '//'-Trennzeichen abschneidet.

Wiederherstellung: Hängen Sie '//\n' an das Ende der Datei an mit dem File2File Bioinformatik-Tool.

Sicherheitsanalyse & Parser-Angriffsvektore

GenBank-Parser verarbeiten komplexe Merkmals-Positionsstrings, bei denen reguläres Backtracking ein Denial-of-Service auslösen kann.

Bekannte Angriffsvektore

  • Regular Expression Denial of Service (ReDoS) in komplexen Parsern für Merkmalsstandorte.
  • Pufferüberlauf beim Lesen übermäßig langer Zitationsreferenztitel.
  • Denial-of-Service durch zirkuläre Merkmalsreferenzschleifen.

Bewährte Sicherheitsverfahren:

Historische Ursprünge & Meilensteine

2023Die GenBank-Datenbank überschreitet 2,5 Milliarden Nukleotidsequenzen und 3 Billionen Basenpaare.
1992Das NCBI übernimmt die vollständige Verwaltung von GenBank vom Los Alamos National Laboratory.
1982Eingerichtet von Walter Goad am Los Alamos National Laboratory mit NIH-Mitteln.

Hauptvorteile & Stärken

  • Umfangreiche, detaillierte Metadaten: speichert Gen-Grenzen, Promotor-Standorte, Exons, Introns und translatierte Proteinsequenzen.
  • Enthält vollständige Verweise auf wissenschaftliche Literatur, PubMed-IDs, Autorennamen und experimentelle Einreichungsdaten.
  • Universelles Austauschformat für synthetische Biologie, Plasmid-Design (SnapGene) und Einreichungen in die NCBI-Datenbank.

Technische Einschränkungen & Nachteile

  • Signifikant ausführlicher und größere Dateigrößen als reine FASTA-Sequenzen.
  • Das Parsen von Merkmalstabellen-Koordinaten ('join(complement(100..500),600..800)') erfordert eine komplexe Parser-Logik.
  • Nicht für das Alignment massiver Hochdurchsatz-Sequenzierungsreads ausgelegt.

Interessante technische Wissenswertes

  • Jeder GenBank-Eintrag beginnt mit dem Wort 'LOCUS' und endet mit zwei Schrägstrichen '//' in einer eigenen Zeile.
  • GenBank synchronisiert seine Daten täglich mit dem European Molecular Biology Laboratory (EMBL) und der DNA Data Bank of Japan (DDBJ).
  • Synthetische Biologen verwenden GenBank-Dateien, um kundenspezifische kreisförmige Plasmide für die CRISPR-Genbearbeitung und Insulinproduktion zu entwerfen.

Häufig gestellte technische Fragen

Was ist der Unterschied zwischen FASTA und dem GenBank-Format?

FASTA enthält nur die rohe DNA-Sequenz mit einer kurzen Kopfzeile. GenBank enthält die rohe Sequenz PLUS alle Genannotationen, Proteinübersetzungen, Autoren und wissenschaftlichen Hinweise.

Wie kann ich GenBank (.gb) in FASTA konvertieren?

Sie können GenBank-Dateien mit File2File.app direkt in Ihrem Browser mit einem Klick in saubere FASTA-Nukleotid- oder Proteinsequenzen konvertieren.

Welche Software öffnet GenBank-Dateien?

SnapGene, Benchling, UGENE, Artemis und File2File.app können GenBank-Dateien anzeigen und bearbeiten.