FASTA配列 (.fasta)

Bioinformatics 標準

FASTAは、バイオインフォマティクスおよびゲノミクスの普遍的かつ基礎的なファイル形式であり、普遍的な1文字コードを使用して塩基配列(DNA、RNA)およびアミノ酸タンパク質配列を表現します。

FASTA を GENBANK に変換

無料のブラウザ内 FASTA から GENBANK へのコンバーター。お使いのデバイスでファイルを即座に変換します。

調査とメタデータ

オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで FASTA ファイルを識別します:

ここにファイルを選択またはドロップ

100%プライベートなブラウザ内変換 - ファイルがデバイスから外部に出ることはありません

または貼り付け Ctrl+V
ネットワーク送信ゼロのプライバシー保証: 外部サーバーへのデータ送信は0バイトです。すべての処理はお使いのブラウザのサンドボックス内でローカルに実行されます。

バイトレベルのヘッダーシグネチャ (マジックバイト)

オペレーティングシステムやファイル解析ツールは、先頭のバイナリバイトシーケンスを検査することで FASTA ファイルを識別します:

16進数シグネチャ (オフセット 0):

3E

ASCII表現: >

標準化: Bioinformatics de facto global standard

技術仕様

コンテナアーキテクチャPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
圧縮Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
バイトエンディアンASCII / UTF-8 text stream
色空間N/A (Genomic Sequence Data)
チャンネルと構造Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
最大寸法Unbounded sequence length (supports entire human chromosomes over 250 million base pairs)
透過性None
ストリーミングとプログレッシブSequential record-by-record streaming processing

技術比較マトリックス: FASTA 対 競合製品

技術属性FASTA (現在)FASTQGENBANKGFF
品質スコアなし(純粋な配列文字)塩基ごとのPhred品質スコアなし(特徴注釈)なし(特徴座標)
ヘッダー行「>」文字で始まる「@」文字で始まる構造化されたLOCUSブロックタブ区切りのゲノム列
主な用途参照ゲノムとBLAST検索生の高スループットシークエンサー(Illumina)包括的な注釈付き遺伝子ゲノム特徴アノテーション
ファイルサイズ(ヒト)非圧縮で約3ギガバイト約100ギガバイト以上(品質情報含む)マルチギガバイトのリッチテキスト約50メガバイト

一般的な破損モードと16進数リカバリガイド

バイオインフォマティクスツールが「行Xに無効な配列文字があります」と報告する。

根本原因: 配列行内の空白、数字、またはIUPAC以外の文字。

復旧: File2File Bioinformatics Toolを使用して配列文字をフィルタリングおよびクリーンアップします。

セキュリティ分析とパーサー攻撃ベクトル

ゲノミクスツールは、配列座標のインデックス作成時に整数オーバーフローが発生する可能性がある、数ギガバイトに及ぶ巨大なFASTAファイルを解析します。

既知の攻撃ベクター

  • 2^31塩基対を超える32ビット配列インデクサー(FAI)での整数オーバーフロー。
  • 過度に長い配列識別子ヘッダーを読み取る際のバッファオーバーフロー。
  • 異常なアライメントクエリによるサービス拒否。

防御的ベストプラクティス:

歴史的背景とマイルストーン

2003ヒトゲノム計画がヒトゲノムの最初の解読を完了し、結果をFASTA形式で公開。
1990BLAST(Basic Local Alignment Search Tool)がFASTAを標準入力形式として採用。
1985ウィリアム・ピアソンとデヴィッド・リップマンが、FASTP配列アライメントソフトウェアと共にFASTAを導入。

主な利点とメリット

  • 計算生物学における揺るぎない世界標準:地球上のすべてのゲノムツール、シークエンサー、データベースで使用されています。
  • 極めてシンプルな構造:1行目が「>」で始まり、その後にIDが続き、その後にプレーンテキストの遺伝子文字が続きます。
  • マルチ配列の容量:1つのファイルに何千もの個別の遺伝子や完全なウイルスゲノムを含めることができます。

技術的な制限とデメリット

  • シーケンシングの品質スコアが含まれていません(塩基ごとのPhred信頼度スコアを保存するFASTQとは異なります)。
  • 最初の識別子以外のヘッダー行に対する標準化されたメタデータ構文がありません。
  • Gzipや特殊なゲノム圧縮を使用しない場合、全ゲノムデータセットの膨大なストレージフットプリント。

興味深い技術トリビア

  • 30億塩基対からなるヒトゲノム全体をFASTA形式で表現でき、約3ギガバイトのストレージ容量を消費します。
  • FASTAファイルに保存されるDNAの4つの文字は、A(アデニン)、C(シトシン)、G(グアニン)、T(チミン)です。
  • 2020年1月、COVID-19コロナウイルスのゲノムが最初に解読された際、科学者たちは3万文字のFASTAファイルとして世界中に共有しました。

よくある技術的な質問

FASTAファイルとは何ですか?

FASTAファイルは、生物学においてDNA、RNA、またはタンパク質の配列を1文字の略称を使用して保存するために使用されるプレーンテキストファイルです。

FASTAとFASTQの違いは何ですか?

FASTAには遺伝子配列の文字のみが保存されますが、FASTQには文字に加えて各塩基の配列決定の精度を示すクオリティスコアも保存されます。

FASTAファイルを表示するにはどうすればよいですか?

任意のテキストエディタでFASTAファイルを開くか、JalviewやUGENEなどのバイオインフォマティクスソフトウェアで表示するか、File2File.appを使用して変換できます。