GenBankフラットファイル (.gb)
NCBI 標準NCBI GenBankフラットファイル(.gb / .gbk)は、米国国立衛生研究所(NIH)が維持管理するゲノム注釈のゴールドスタンダード形式であり、完全なDNA配列に詳細な遺伝子位置、コード領域、および科学文献の引用を組み合わせています。
FASTA を GENBANK に変換
無料のブラウザ内 FASTA から GENBANK へのコンバーター。お使いのデバイスでファイルを即座に変換します。
調査とメタデータ
オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで GenBank ファイルを識別します:
バイトレベルのヘッダーシグネチャ (マジックバイト)
オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで GenBank ファイルを識別します:
16進数シグネチャ (オフセット 0):
4C 4F 43 55 53 20 20 20 20 20ASCII表現: LOCUS
標準化: NCBI GenBank Release Specification
技術仕様
| コンテナアーキテクチャ | Plaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//' |
| 圧縮 | Uncompressed text (often compressed with Gzip as .gb.gz) |
| バイトエンディアン | UTF-8 / ASCII text stream |
| 色空間 | N/A (Genomic Annotation Database) |
| チャンネルと構造 | DNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations |
| 最大寸法 | Unbounded sequence and feature count |
| 透過性 | None |
| ストリーミングとプログレッシブ | Record-by-record streaming: individual GenBank entries are delimited by '//' lines |
技術比較マトリックス: GenBank 対 競合製品
| 技術属性 | GenBank (現在) | FASTA | GFF | FASTQ |
|---|---|---|---|---|
| 注釈の詳細 | 網羅的(遺伝子、CDS、引用、翻訳) | なし(配列のみ) | 表形式のゲノム座標 | シークエンス品質スコアのみ |
| 含まれる配列 | あり(末尾のORIGINブロック内) | あり(純粋な配列) | なし(座標のみ) | あり(生リード) |
| 主要なツール | NCBI, SnapGene, Benchling | BLAST、アライメントツール | ゲノムブラウザ(UCSC、IGV) | Illuminaシークエンサー |
| レコード終端 | 独立した行の // | 次の '>' ヘッダー行 | ファイルの終わり | 次の '@' 行 |
一般的な破損モードと16進数リカバリガイド
バイオインフォマティクスソフトウェアが「GenBankパーサーエラー://前の予期せぬEOF」と報告する。
根本原因: 最終的な配列オリジンブロックまたは「//」デリミタを切断する不完全なダウンロード。
復旧: File2Fileバイオインフォマティクスツールを使用して、ファイルの末尾に「//\n」を追加する。
セキュリティ分析とパーサー攻撃ベクトル
GenBankパーサーは、正規表現のバックトラッキングがサービス拒否を引き起こす可能性のある、複雑な機能位置文字列を処理します。
既知の攻撃ベクター
- 複雑な機能位置パーサーにおける正規表現サービス拒否(ReDoS)。
- 過度に長い引用参考文献タイトルを読み取る際のバッファオーバーフロー。
- 循環機能参照ループによるサービス拒否。
防御的ベストプラクティス:
歴史的背景とマイルストーン
主な利点とメリット
- 豊富で包括的なメタデータ:遺伝子の境界、プロモーターの位置、エキソン、イントロン、および翻訳されたタンパク質配列を格納。
- 完全な科学文献の参考文献、PubMed ID、著者名、および実験の提出日を含む。
- 合成生物学、プラスミド設計(SnapGene)、およびNCBIデータベースへの提出のための汎用的な交換形式。
技術的な制限とデメリット
- 単純なFASTA配列と比較して、ファイルサイズが大幅に冗長で大きくなる。
- 機能テーブルの座標('join(complement(100..500),600..800)')の解析には、複雑なパーサーロジックが必要。
- 大規模なハイスループットシーケンスのリード整列用には設計されていない。
興味深い技術トリビア
- すべてのGenBankエントリは「LOCUS」という単語で始まり、独立した行にある2つのスラッシュ「//」で終了する。
- GenBankは、欧州分子生物学研究所(EMBL)および日本DNAデータバンク(DDBJ)と毎日データを同期している。
- 合成生物学者はGenBankファイルを使用して、CRISPR遺伝子編集やインスリン生産のためのカスタム環状プラスミドを設計する。
よくある技術的な質問
FASTAとGenBank形式の違いは何ですか?
FASTAには、簡単なヘッダー行が付いた未加工のDNA配列のみが含まれています。GenBankには、未加工の配列に加え、すべての遺伝子アノテーション、タンパク質翻訳、著者、科学的注記が含まれています。
GenBank(.gb)をFASTAに変換するにはどうすればよいですか?
ブラウザから直接File2File.appを使用して、1回クリックするだけでGenBankファイルをクリーンなFASTAヌクレオチドまたはタンパク質配列に変換できます。
GenBankファイルを開くソフトウェアは何ですか?
SnapGene、Benchling、UGENE、Artemis、およびFile2File.appを使用してGenBankファイルの表示と編集ができます。