GenBank файл (.gb)

NCBI Стандарт

Обикновеният текстов файл NCBI GenBank (.gb / .gbk) е злалният стандарт за формат на геномни анотации, поддържан от Националните институти по здравеопазване (NIH), съчетаващ пълни ДНК последователности с подробни местоположения на гени, кодиращи региони и цитати от научната литература.

Конвертиране на FASTA към GENBANK

Безплатен конвертор от FASTA към GENBANK в браузъра. Конвертирайте файлове незабавно на вашето устройство.

Инспектиране и метаданни

Операционните системи и файловите анализатори идентифицират GenBank файлове чрез проверка на началната двоична байтова последователност:

Изберете или пуснете файлове тук

100% поверително конвертиране в браузъра - файловете никога не напускат вашето устройство

или поставете Ctrl+V
Гаранция за поверителност с нулево мрежово предаване: 0 байта са качени на външни сървъри. Цялата обработка се извършва локално в пясъчниците на вашия браузър.

Байтов подпис на хедъра (Magic Bytes)

Операционните системи и файловите анализатори идентифицират GenBank файлове чрез проверка на началната двоична байтова последователност:

HEX ПОДПИС (ОФСЕТ 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII ПРЕДСТАВЯНЕ: LOCUS

Стандартизация: NCBI GenBank Release Specification

Технически спецификации

Контейнерна архитектураPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
КомпресияUncompressed text (often compressed with Gzip as .gb.gz)
Поредност на байтовете (Endianness)UTF-8 / ASCII text stream
Цветови пространстваN/A (Genomic Annotation Database)
Канали и структураDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Максимални размериUnbounded sequence and feature count
ПрозрачностNone
Стрийминг и прогресивно зарежданеRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Техническа сравнителна матрица: GenBank спрямо конкуренти

Технически атрибутGenBank (Текущ)FASTAGFFFASTQ
Детайлност на анотациятаИзчерпателна (гени, CDS, цитати, транслация)Няма (само последователност)Таблични геномни координатиСамо резултати за качество на секвенирането
Включена последователностДа (в блок ORIGIN в края)Да (чиста последователност)Не (само координати)Да (сурови четения)
Основен софтуерNCBI, SnapGene, BenchlingBLAST, инструменти за подравняванеГеномни браузъри (UCSC, IGV)Секвенатори Illumina
Прекъсвач на запис// на самостоятелен редСледващ заглавен ред '>'Край на файлаСледващ ред '@'

Често срещани режими на повреда и ръководство за хекс възстановяване

Биоинформатичният софтуер докладва 'GenBank parser error: premature EOF before //'.

Първопричина: Прекъснато изтегляне, което прекъсва крайния блок на произхода на последователността или разделителя '//'.

Възстановяване: Добавете '//\n' в края на файла с помощта на File2File Bioinformatics Tool.

Анализ на сигурността и вектори на атака към парсера

Парсерите на GenBank обработват сложни низове за местоположение на признаци, където обратното проследяване на регулярни изрази (regular expression backtracking) може да предизвика отказ от услуга.

Известни вектори на атака

  • Отказ от услуга чрез регулярни изрази (ReDoS) в парсери за сложни местоположения на признаци.
  • Препълване на буфера при четене на прекалено дълги заглавия на цитирани източници.
  • Отказ от услуга чрез цикли с препратки към кръгови признаци.

Защитни добри практики:

Исторически произход и етапи

2023Базата данни GenBank надминава 2,5 милиарда нуклеотидни последователности и 3 трилиона базови двойки.
1992NCBI поема пълното управление на GenBank от Националната лаборатория в Лос Аламос.
1982Създаден от Уолтър Гоуд в Националната лаборатория в Лос Аламос с финансиране от NIH.

Основни предимства и плюсове

  • Богати и изчерпателни метаданни: съхранява граници на гени, местоположения на промотори, екзони, интрони и транслирани протеинови последователности.
  • Включва пълни препратки към научна литература, PubMed ID номера, имена на автори и дати на експериментално подаване.
  • Универсален формат за обмен за синтетична биология, плазмиден дизайн (SnapGene) и подаване към бази данни на NCBI.

Технически ограничения и минуси

  • Значително по-многословни и по-големи размери на файловете в сравнение с обикновените FASTA последователности.
  • Анализирането на координати на таблици с признаци ('join(complement(100..500),600..800)') изисква сложна логика на парсера.
  • Не е проектиран за масивно подравняване на четения от секвениране с висока пропускателна способност (high-throughput sequencing).

Интересни технически факти

  • Всеки запис в GenBank започва с думата 'LOCUS' и завършва с две наклонени черти '//' на отделен ред.
  • GenBank синхронизира данните си ежедневно с Европейската лаборатория по молекулярна биология (EMBL) и Банката за ДНК данни на Япония (DDBJ).
  • Синтетичните биолози използват GenBank файлове за проектиране на персонализирани кръгови плазмиди за генно редактиране с CRISPR и производство на инсулин.

Често задавани технически въпроси

Каква е разликата между FASTA и GenBank формат?

FASTA съдържа само суровата ДНК последователност с кратък заглавен ред. GenBank съдържа суровата последователност ПЛЮС всички анотации на гени, протеинови транслации, автори и научни бележки.

Как мога да конвертирам GenBank (.gb) във FASTA?

Можете да конвертирате GenBank файлове в чисти FASTA нуклеотидни или протеинови последователности с едно кликване, използвайки File2File.app директно в браузъра си.

Кой софтуер отваря GenBank файлове?

SnapGene, Benchling, UGENE, Artemis и File2File.app могат да преглеждат и редактират GenBank файлове.