GenBank-Flatfile (.gb)
NCBI StandardDie NCBI GenBank Flat File (.gb / .gbk) ist das Goldstandard-Format für Genomannotationen, gepflegt von den National Institutes of Health (NIH), und kombiniert vollständige DNA-Sequenzen mit detaillierten Genpositionen, kodierenden Regionen und Zitaten wissenschaftlicher Literatur.
Von FASTA zu GENBANK konvertieren
Kostenloser Konverter von FASTA zu GENBANK im Browser. Konvertieren Sie Dateien sofort auf Ihrem Gerät.
Untersuchen & Metadaten
Betriebssysteme und Dateianalysatoren identifizieren GenBank-Dateien durch Untersuchung der führenden binären Byte-Sequenz:
Byte-basierte Headersignatur (Magic Bytes)
Betriebssysteme und Dateianalysatoren identifizieren GenBank-Dateien durch Untersuchung der führenden binären Byte-Sequenz:
HEX-SIGNATUR (OFFSET 0):
4C 4F 43 55 53 20 20 20 20 20ASCII-DARSTELLUNG: LOCUS
Standardisierung: NCBI GenBank Release Specification
Technische Daten
| Container-Architektur | Plaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//' |
| Kompression | Uncompressed text (often compressed with Gzip as .gb.gz) |
| Byte-Endianness | UTF-8 / ASCII text stream |
| Farbräume | N/A (Genomic Annotation Database) |
| Kanäle & Struktur | DNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations |
| Max. Abmessungen | Unbounded sequence and feature count |
| Transparenz | None |
| Streaming & Progressiv | Record-by-record streaming: individual GenBank entries are delimited by '//' lines |
Technischer Vergleich: GenBank im Vergleich zu Wettbewerbern
| Technisches Attribut | GenBank (Aktuell) | FASTA | GFF | FASTQ |
|---|---|---|---|---|
| Annahmedetail | Erschöpfend (Gen, CDS, Zitationen, Translation) | Keine (nur Sequenz) | Tabellarische Genomkoordinaten | Nur Sequenzierungsqualitätswerte |
| Enthaltene Sequenz | Ja (im ORIGIN-Block am Ende) | Ja (reine Sequenz) | Nein (nur Koordinaten) | Ja (Roh-Reads) |
| Primäre Werkzeuge | NCBI, SnapGene, Benchling | BLAST, Alignment-Tools | Genom-Browser (UCSC, IGV) | Illumina-Sequenzierer |
| Datensatz-Terminator | // in eigener Zeile | Nächste '>' Kopfzeile | Dateiende | Nächste '@' Zeile |
Häufige Korruptionsarten & Hex-Wiederherstellungsleitfaden
Bioinformatik-Software meldet 'GenBank-Parser-Fehler: vorzeitiges Dateiende vor //'.
Ursache: Ein abgebrochener Download, der den letzten Sequenz-Origin-Block oder das '//'-Trennzeichen abschneidet.
Wiederherstellung: Hängen Sie '//\n' an das Ende der Datei an mit dem File2File Bioinformatik-Tool.
Sicherheitsanalyse & Parser-Angriffsvektore
GenBank-Parser verarbeiten komplexe Merkmals-Positionsstrings, bei denen reguläres Backtracking ein Denial-of-Service auslösen kann.
Bekannte Angriffsvektore
- Regular Expression Denial of Service (ReDoS) in komplexen Parsern für Merkmalsstandorte.
- Pufferüberlauf beim Lesen übermäßig langer Zitationsreferenztitel.
- Denial-of-Service durch zirkuläre Merkmalsreferenzschleifen.
Bewährte Sicherheitsverfahren:
Historische Ursprünge & Meilensteine
Hauptvorteile & Stärken
- Umfangreiche, detaillierte Metadaten: speichert Gen-Grenzen, Promotor-Standorte, Exons, Introns und translatierte Proteinsequenzen.
- Enthält vollständige Verweise auf wissenschaftliche Literatur, PubMed-IDs, Autorennamen und experimentelle Einreichungsdaten.
- Universelles Austauschformat für synthetische Biologie, Plasmid-Design (SnapGene) und Einreichungen in die NCBI-Datenbank.
Technische Einschränkungen & Nachteile
- Signifikant ausführlicher und größere Dateigrößen als reine FASTA-Sequenzen.
- Das Parsen von Merkmalstabellen-Koordinaten ('join(complement(100..500),600..800)') erfordert eine komplexe Parser-Logik.
- Nicht für das Alignment massiver Hochdurchsatz-Sequenzierungsreads ausgelegt.
Interessante technische Wissenswertes
- Jeder GenBank-Eintrag beginnt mit dem Wort 'LOCUS' und endet mit zwei Schrägstrichen '//' in einer eigenen Zeile.
- GenBank synchronisiert seine Daten täglich mit dem European Molecular Biology Laboratory (EMBL) und der DNA Data Bank of Japan (DDBJ).
- Synthetische Biologen verwenden GenBank-Dateien, um kundenspezifische kreisförmige Plasmide für die CRISPR-Genbearbeitung und Insulinproduktion zu entwerfen.
Häufig gestellte technische Fragen
Was ist der Unterschied zwischen FASTA und dem GenBank-Format?
FASTA enthält nur die rohe DNA-Sequenz mit einer kurzen Kopfzeile. GenBank enthält die rohe Sequenz PLUS alle Genannotationen, Proteinübersetzungen, Autoren und wissenschaftlichen Hinweise.
Wie kann ich GenBank (.gb) in FASTA konvertieren?
Sie können GenBank-Dateien mit File2File.app direkt in Ihrem Browser mit einem Klick in saubere FASTA-Nukleotid- oder Proteinsequenzen konvertieren.
Welche Software öffnet GenBank-Dateien?
SnapGene, Benchling, UGENE, Artemis und File2File.app können GenBank-Dateien anzeigen und bearbeiten.
Ähnliche GenBank-Konvertierungspaare
Die Konvertierung einer einfachen FASTA-Sequenz in ein GenBank-Flatfile fügt dem rohen genetischen Code wesentliche biologische Annotationen und Metadaten hinzu.
Die Konvertierung eines GenBank-Flatfiles in eine FASTA-Sequenz entfernt die Annotationsmetadaten, sodass nur die für schnelle Bioinformatikanalysen erforderlichen rohen Nukleotid- oder Aminosäuresequenzen verbleiben.