FASTA配列 (.fasta)
Bioinformatics 標準FASTAは、バイオインフォマティクスおよびゲノミクスの普遍的かつ基礎的なファイル形式であり、普遍的な1文字コードを使用して塩基配列(DNA、RNA)およびアミノ酸タンパク質配列を表現します。
FASTA を GENBANK に変換
無料のブラウザ内 FASTA から GENBANK へのコンバーター。お使いのデバイスでファイルを即座に変換します。
調査とメタデータ
オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで FASTA ファイルを識別します:
バイトレベルのヘッダーシグネチャ (マジックバイト)
オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで FASTA ファイルを識別します:
16進数シグネチャ (オフセット 0):
3EASCII表現: >
標準化: Bioinformatics de facto global standard
技術仕様
| コンテナアーキテクチャ | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| 圧縮 | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| バイトエンディアン | ASCII / UTF-8 text stream |
| 色空間 | N/A (Genomic Sequence Data) |
| チャンネルと構造 | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| 最大寸法 | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| 透過性 | None |
| ストリーミングとプログレッシブ | Sequential record-by-record streaming processing |
技術比較マトリックス: FASTA 対 競合製品
| 技術属性 | FASTA (現在) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| 品質スコア | なし(純粋な配列文字) | 塩基ごとのPhred品質スコア | なし(特徴注釈) | なし(特徴座標) |
| ヘッダー行 | 「>」文字で始まる | 「@」文字で始まる | 構造化されたLOCUSブロック | タブ区切りのゲノム列 |
| 主な用途 | 参照ゲノムとBLAST検索 | 生の高スループットシークエンサー(Illumina) | 包括的な注釈付き遺伝子 | ゲノム特徴アノテーション |
| ファイルサイズ(ヒト) | 非圧縮で約3ギガバイト | 約100ギガバイト以上(品質情報含む) | マルチギガバイトのリッチテキスト | 約50メガバイト |
一般的な破損モードと16進数リカバリガイド
バイオインフォマティクスツールが「行Xに無効な配列文字があります」と報告する。
根本原因: 配列行内の空白、数字、またはIUPAC以外の文字。
復旧: File2File Bioinformatics Toolを使用して配列文字をフィルタリングおよびクリーンアップします。
セキュリティ分析とパーサー攻撃ベクトル
ゲノミクスツールは、配列座標のインデックス作成時に整数オーバーフローが発生する可能性がある、数ギガバイトに及ぶ巨大なFASTAファイルを解析します。
既知の攻撃ベクター
- 2^31塩基対を超える32ビット配列インデクサー(FAI)での整数オーバーフロー。
- 過度に長い配列識別子ヘッダーを読み取る際のバッファオーバーフロー。
- 異常なアライメントクエリによるサービス拒否。
防御的ベストプラクティス:
歴史的背景とマイルストーン
主な利点とメリット
- 計算生物学における揺るぎない世界標準:地球上のすべてのゲノムツール、シークエンサー、データベースで使用されています。
- 極めてシンプルな構造:1行目が「>」で始まり、その後にIDが続き、その後にプレーンテキストの遺伝子文字が続きます。
- マルチ配列の容量:1つのファイルに何千もの個別の遺伝子や完全なウイルスゲノムを含めることができます。
技術的な制限とデメリット
- シーケンシングの品質スコアが含まれていません(塩基ごとのPhred信頼度スコアを保存するFASTQとは異なります)。
- 最初の識別子以外のヘッダー行に対する標準化されたメタデータ構文がありません。
- Gzipや特殊なゲノム圧縮を使用しない場合、全ゲノムデータセットの膨大なストレージフットプリント。
興味深い技術トリビア
- 30億塩基対からなるヒトゲノム全体をFASTA形式で表現でき、約3ギガバイトのストレージ容量を消費します。
- FASTAファイルに保存されるDNAの4つの文字は、A(アデニン)、C(シトシン)、G(グアニン)、T(チミン)です。
- 2020年1月、COVID-19コロナウイルスのゲノムが最初に解読された際、科学者たちは3万文字のFASTAファイルとして世界中に共有しました。
よくある技術的な質問
FASTAファイルとは何ですか?
FASTAファイルは、生物学においてDNA、RNA、またはタンパク質の配列を1文字の略称を使用して保存するために使用されるプレーンテキストファイルです。
FASTAとFASTQの違いは何ですか?
FASTAには遺伝子配列の文字のみが保存されますが、FASTQには文字に加えて各塩基の配列決定の精度を示すクオリティスコアも保存されます。
FASTAファイルを表示するにはどうすればよいですか?
任意のテキストエディタでFASTAファイルを開くか、JalviewやUGENEなどのバイオインフォマティクスソフトウェアで表示するか、File2File.appを使用して変換できます。