GenBankフラットファイル (.gb)

NCBI 標準

NCBI GenBankフラットファイル(.gb / .gbk)は、米国国立衛生研究所(NIH)が維持管理するゲノム注釈のゴールドスタンダード形式であり、完全なDNA配列に詳細な遺伝子位置、コード領域、および科学文献の引用を組み合わせています。

FASTA を GENBANK に変換

無料のブラウザ内 FASTA から GENBANK へのコンバーター。お使いのデバイスでファイルを即座に変換します。

調査とメタデータ

オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで GenBank ファイルを識別します:

ここにファイルを選択またはドロップ

100%プライベートなブラウザ内変換 - ファイルがデバイスから外部に出ることはありません

または貼り付け Ctrl+V
ネットワーク送信ゼロのプライバシー保証: 外部サーバーへのデータ送信は0バイトです。すべての処理はお使いのブラウザのサンドボックス内でローカルに実行されます。

バイトレベルのヘッダーシグネチャ (マジックバイト)

オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで GenBank ファイルを識別します:

16進数シグネチャ (オフセット 0):

4C 4F 43 55 53 20 20 20 20 20

ASCII表現: LOCUS

標準化: NCBI GenBank Release Specification

技術仕様

コンテナアーキテクチャPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
圧縮Uncompressed text (often compressed with Gzip as .gb.gz)
バイトエンディアンUTF-8 / ASCII text stream
色空間N/A (Genomic Annotation Database)
チャンネルと構造DNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
最大寸法Unbounded sequence and feature count
透過性None
ストリーミングとプログレッシブRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

技術比較マトリックス: GenBank 対 競合製品

技術属性GenBank (現在)FASTAGFFFASTQ
注釈の詳細網羅的(遺伝子、CDS、引用、翻訳)なし(配列のみ)表形式のゲノム座標シークエンス品質スコアのみ
含まれる配列あり(末尾のORIGINブロック内)あり(純粋な配列)なし(座標のみ)あり(生リード)
主要なツールNCBI, SnapGene, BenchlingBLAST、アライメントツールゲノムブラウザ(UCSC、IGV)Illuminaシークエンサー
レコード終端独立した行の //次の '>' ヘッダー行ファイルの終わり次の '@' 行

一般的な破損モードと16進数リカバリガイド

バイオインフォマティクスソフトウェアが「GenBankパーサーエラー://前の予期せぬEOF」と報告する。

根本原因: 最終的な配列オリジンブロックまたは「//」デリミタを切断する不完全なダウンロード。

復旧: File2Fileバイオインフォマティクスツールを使用して、ファイルの末尾に「//\n」を追加する。

セキュリティ分析とパーサー攻撃ベクトル

GenBankパーサーは、正規表現のバックトラッキングがサービス拒否を引き起こす可能性のある、複雑な機能位置文字列を処理します。

既知の攻撃ベクター

  • 複雑な機能位置パーサーにおける正規表現サービス拒否(ReDoS)。
  • 過度に長い引用参考文献タイトルを読み取る際のバッファオーバーフロー。
  • 循環機能参照ループによるサービス拒否。

防御的ベストプラクティス:

歴史的背景とマイルストーン

2023GenBankデータベースの塩基配列が25億件、塩基対が3兆塩基対を突破。
1992NCBIがロスアラモス国立研究所からGenBankの完全な管理を引き継ぐ。
1982NIHの資金提供のもと、ロスアラモス国立研究所のウォルター・ゴード(Walter Goad)によって設立される。

主な利点とメリット

  • 豊富で包括的なメタデータ:遺伝子の境界、プロモーターの位置、エキソン、イントロン、および翻訳されたタンパク質配列を格納。
  • 完全な科学文献の参考文献、PubMed ID、著者名、および実験の提出日を含む。
  • 合成生物学、プラスミド設計(SnapGene)、およびNCBIデータベースへの提出のための汎用的な交換形式。

技術的な制限とデメリット

  • 単純なFASTA配列と比較して、ファイルサイズが大幅に冗長で大きくなる。
  • 機能テーブルの座標('join(complement(100..500),600..800)')の解析には、複雑なパーサーロジックが必要。
  • 大規模なハイスループットシーケンスのリード整列用には設計されていない。

興味深い技術トリビア

  • すべてのGenBankエントリは「LOCUS」という単語で始まり、独立した行にある2つのスラッシュ「//」で終了する。
  • GenBankは、欧州分子生物学研究所(EMBL)および日本DNAデータバンク(DDBJ)と毎日データを同期している。
  • 合成生物学者はGenBankファイルを使用して、CRISPR遺伝子編集やインスリン生産のためのカスタム環状プラスミドを設計する。

よくある技術的な質問

FASTAとGenBank形式の違いは何ですか?

FASTAには、簡単なヘッダー行が付いた未加工のDNA配列のみが含まれています。GenBankには、未加工の配列に加え、すべての遺伝子アノテーション、タンパク質翻訳、著者、科学的注記が含まれています。

GenBank(.gb)をFASTAに変換するにはどうすればよいですか?

ブラウザから直接File2File.appを使用して、1回クリックするだけでGenBankファイルをクリーンなFASTAヌクレオチドまたはタンパク質配列に変換できます。

GenBankファイルを開くソフトウェアは何ですか?

SnapGene、Benchling、UGENE、Artemis、およびFile2File.appを使用してGenBankファイルの表示と編集ができます。