GenBank datne (.gb)

NCBI Standarts

NCBI GenBank Flat File (.gb / .gbk) ir Nacionālo veselības institūtu (NIH) uzturētais genoma anotāciju zelta standarts, kas apvieno pilnīgas DNS sekvences ar detalizētām gēnu atrašanās vietām, kodējošajiem reģioniem un zinātniskās literatūras citātiem.

Konvertēt FASTA uz GENBANK

Bezmaksas FASTA uz GENBANK konvertētājs pārlūkprogrammā. Konvertējiet failus uzreiz savā ierīcē.

Pārbaudīt un metadati

Operētājsistēmas un failu analizatori identificē GenBank failus, pārbaudot sākotnējo bināro baitu secību:

Atlasiet vai velciet failus šeit

100% privāta konvertēšana pārlūkprogrammā - faili nekad neatstāj jūsu ierīci

vai ielīmējiet Ctrl+V
Privātuma garantija bez datu pārraides tīklā: 0 baitu augšupielādēti ārējos serveros. Visa apstrāde notika lokāli jūsu pārlūkprogrammas smilškastē.

Baitu līmeņa galvenes paraksts (maģiskie baiti)

Operētājsistēmas un failu analizatori identificē GenBank failus, pārbaudot sākotnējo bināro baitu secību:

HEKSADECIMĀLAIS PARAKSTS (NOBĪDE 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII ATTEIOLOJUMS: LOCUS

Standartizācija: NCBI GenBank Release Specification

Tehniskās specifikācijas

Konteinera arhitektūraPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
SaspiešanaUncompressed text (often compressed with Gzip as .gb.gz)
Baitu secībaUTF-8 / ASCII text stream
Krāsu telpasN/A (Genomic Annotation Database)
Kanāli un struktūraDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Maks. izmēriUnbounded sequence and feature count
CaurspīdīgumsNone
Straumēšana un progresīvā ielādeRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Tehniskā salīdzinājuma matrica: GenBank pret konkurentiem

Tehniskais atribūtsGenBank (Pašreizējais)FASTAGFFFASTQ
Anotācijas detalizācijaIzsmeļoša (gēni, CDS, citāti, tulkojums)Nav (tikai sekvence)Tabulas ģenētiskās koordinātasTikai sekvencēšanas kvalitātes rādītāji
Iekļautā sekvenceJā (ORIGIN blokā beigās)Jā (tīra sekvence)Nē (tikai koordinātas)Jā (neapstrādāti nolasījumi)
Galvenie rīkiNCBI, SnapGene, BenchlingBLAST, izlīdzināšanas rīkiGenoma pārlūkprogrammas (UCSC, IGV)Illumina sekvenēšanas ierīces
Ieraksta beigu rādītājs// uz atsevišķas rindasNākamā '>' galvenes rindaFaila beigasNākamā '@' rinda

Biežākie bojājumu veidi un heksadecimālās atkopšanas ceļvedis

Bioinformātikas programmatūra ziņo: 'GenBank parsētāja kļūda: priekšlaicīgs EOF pirms //'.

Pamatcēlonis: Apgriezta lejupielāde, kas pārtrauc pēdējo sekvences sākuma bloku vai '//' atdalītāju.

Atkopšana: Pievienojiet '//\n' faila beigām, izmantojot File2File bioinformātikas rīku.

Drošības analīze un parsētāja uzbrukuma vektori

GenBank parsētāji apstrādā sarežģītas iezīmju atrašanās vietas virknes, kur regulāro izteiksmju atgriezeniskā meklēšana var izraisīt pakalpojuma atteici.

Zināmie uzbrukuma vektori

  • Regulāro izteiksmju pakalpojuma atteice (ReDoS) sarežģītos pazīmju atrašanās vietas parsētājos.
  • Bufera pārpilde, nolasot pārmērīgi garus citādu references nosaukumus.
  • Pakalpojuma atteice, izmantojot cirkulāras pazīmju references cilpas.

Aizsardzības labākā prakse:

Vēsturiskā izcelsme un pavērsieni

2023GenBank datubāze pārsniedz 2,5 miljardus nukleotīdu sekvenču un 3 triljonus bāzes pāru.
1992NCBI pārņem pilnu GenBank pārvaldību no Losalamosas Nacionālās laboratorijas.
1982To izveidoja Valters Goads Losalamosas Nacionālajā laboratorijā ar NIH finansējumu.

Galvenās priekšrocības un plusi

  • Bagātīgi, visaptveroši metadati: saglabā gēnu robežas, promoteru atrašanās vietas, eksonus, intronus un tulkotās olbaltumvielu sekvences.
  • Ietver pilnas zinātniskās literatūras references, PubMed ID, autoru vārdus un eksperimentu iesniegšanas datumus.
  • Universāls apmaiņas formāts sintētiskajai bioloģijai, plazmīdu dizainam (SnapGene) un NCBI datubāzes iesniegumiem.

Tehniskie ierobežojumi un mīnusi

  • Ievērojami garāki un lielāki failu izmēri nekā vienkāršajām FASTA sekvencēm.
  • Pazīmju tabulas koordinašu parsēšana ('join(complement(100..500),600..800)') prasa sarežģītu parsētāja loģiku.
  • Nav paredzēts masveida augstas caurlaides sekvencēšanas nolasījumu izlīdzināšanai.

Interesanti tehniski fakti

  • Katrs GenBank ieraksts sākas ar vārdu 'LOCUS' un beidzas ar divām slīpsvītrām '//' atsevišķā rindā.
  • GenBank katru dienu sinhronizē savus datus ar Eiropas Molekulārās bioloģijas laboratoriju (EMBL) un Japānas DNS datubāzi (DDBJ).
  • Sintētiskie biologi izmanto GenBank failus, lai izstrādātu pielāgotas cirkulārās plazmīdas CRISPR gēnu rediģēšanai un insulīna ražošanai.

Bieži uzdotie tehniskie jautājumi

Kāda ir atšķirība starp FASTA un GenBank formātu?

FASTA satur tikai neapstrādātu DNS secību ar īsu galvenes rindiņu. GenBank satur neapstrādāto secību PLUS visas gēnu anotācijas, proteīnu translācijas, autorus un zinātniskās piezīmes.

Kā varu konvertēt GenBank (.gb) uz FASTA?

Varat konvertēt GenBank failus tīrās FASTA nukleotīdu vai proteīnu secībās ar vienu klikšķi, izmantojot File2File.app tieši savā pārlūkprogrammā.

Kāda programmatūra atver GenBank failus?

SnapGene, Benchling, UGENE, Artemis un File2File.app var skatīt un rediģēt GenBank failus.