GenBank-flatfil (.gb)

NCBI Standard

NCBI GenBank Flat File (.gb / .gbk) är guldstandarden för genomiska anmärkningar (annotationer) som underhålls av National Institutes of Health (NIH). Det kombinerar komplett DNA-sekvens med detaljerade genpositioner, kodande regioner och referenser till vetenskaplig litteratur.

Konvertera FASTA till GENBANK

Gratis konverterare från FASTA till GENBANK i webbläsaren. Konvertera filer direkt på din enhet.

Granska & Metadata

Operativsystem och filanalysverktyg identifierar GenBank-filer genom att granska den inledande binära bytesekvensen:

Välj eller släpp filer här

100 % privat konvertering i webbläsaren - filer lämnar aldrig din enhet

eller klistra in Ctrl+V
Integritetsgaranti utan nätverksöverföring: 0 byte laddas upp till externa servrar. All bearbetning sker lokalt i webbläsarens sandlåda.

Signatur för filhuvud på bytenivå (Magic Bytes)

Operativsystem och filanalysverktyg identifierar GenBank-filer genom att granska den inledande binära bytesekvensen:

HEX-SIGNATUR (OFFSET 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII-REPRESENTATION: LOCUS

Standardisering: NCBI GenBank Release Specification

Tekniska specifikationer

ContainerarkitekturPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
KomprimeringUncompressed text (often compressed with Gzip as .gb.gz)
BytessordinningUTF-8 / ASCII text stream
FärgrymderN/A (Genomic Annotation Database)
Kanaler och strukturDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Maximala dimensionerUnbounded sequence and feature count
TransparensNone
Strömning och progressivRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Teknisk jämförelsematris: GenBank vs konkurrenter

Tekniskt attributGenBank (Aktuell)FASTAGFFFASTQ
Detaljnivå för annotationUttömmande (gener, CDS, citat, översättning)Ingen (endast sekvens)Tabellariska genomiska koordinaterEndast kvalitetsresultat för sekvensering
Inkluderad sekvensJa (i ORIGIN-blocket i slutet)Ja (ren sekvens)Nej (endast koordinater)Ja (råa läsningar)
Primära verktygNCBI, SnapGene, BenchlingBLAST, matchningsverktyg (alignment tools)Genombläddrare (UCSC, IGV)Illumina-sekvenserare
Postavslutare// på en fristående radNästa '>' huvudadressradFilens slutNästa '@'-rad

Vanliga skadeorsaker och hex-återställningsguide

Bioinformatikprogramvara rapporterar 'GenBank parser error: premature EOF before //'.

Grundorsak: En avbruten nedladdning som kapade det sista sekvensursprungsblocket eller '//'-avgränsaren.

Återställning: Lägg till '//\n' i slutet av filen med hjälp av File2File Bioinformatics Tool.

Säkerhetsanalys och attackvektorer för tolkar

GenBank-tolkar (parsers) bearbetar komplexa strängar för funktionspositioner där reguljära uttrycks backtrackning kan utlösa överbelastningsattacker (DoS).

Kända attackvektorer

  • Överbelastningsattack genom reguljära uttryck (ReDoS) i tolkar för komplexa funktionspositioner.
  • Buffertspill vid inläsning av extremt långa titlar för citerade referenser.
  • Neka till tjänst (DoS) genom cirkulära referensloopar för funktioner.

Rekommenderade skyddsåtgärder:

Historiskt ursprung och milstolpar

2023GenBank-databasen överstiger 2,5 miljarder nukleotidsekvenser och 3 biljoner baspar.
1992NCBI övertar ansvaret för den fullständiga hanteringen av GenBank från Los Alamos National Laboratory.
1982Etableras av Walter Goad vid Los Alamos National Laboratory med finansiering från NIH.

Viktiga fördelar

  • Rik och heltäckande metadata: lagrar geners gränser, promotorpositioner, exoner, introner och översatta proteiner.
  • Innehåller fullständiga referenser till vetenskaplig litteratur, PubMed-ID, författarnamn och experimentella inlämningsdatum.
  • Universellt utbytesformat för syntetisk biologi, plasmiddesign (SnapGene) och inlämning till NCBI-databaser.

Tekniska begränsningar

  • Betydligt mer ordrikt och resulterar i större filstorlekar än rena FASTA-sekvenser.
  • Att tolka koordinater för funktionstabeller ('join(complement(100..500),600..800)') kräver komplex tolkningslogik (parser-logik).
  • Ej utformat för massiv anpassning av högt genomströmmande sekvenseringsläsningar (high-throughput sequencing reads).

Intressant teknisk kuriosa

  • Varje GenBank-post börjar med ordet 'LOCUS' och avslutas med två snedstreck '//' på en egen rad.
  • GenBank synkroniserar sina data dagligen med European Molecular Biology Laboratory (EMBL) och DNA Data Bank of Japan (DDBJ).
  • Syntetiska biologer använder GenBank-filer för att designa anpassade cirkulära plasmider för CRISPR-genredigering och insulinproduktion.

Vanliga tekniska frågor

Vad är skillnaden mellan FASTA- och GenBank-formatet?

FASTA innehåller endast den råa DNA-sekvensen med en kort huvrad. GenBank innehåller den råa sekvensen PLUS alla genanteckningar, proteinöversättningar, författare och vetenskapliga anteckningar.

Hur kan jag konvertera GenBank (.gb) till FASTA?

Du kan konvertera GenBank-filer till rena FASTA-nukleotid- eller proteinsekvenser med ett klick direkt i din webbläsare med File2File.app.

Vilken programvara öppnar GenBank-filer?

SnapGene, Benchling, UGENE, Artemis och File2File.app kan visa och redigera GenBank-filer.