FASTA 序列 (.fasta)

Bioinformatics 标准

FASTA 是生物信息学和基因 Genomics 领域无处不在的基石文件格式,使用通用的单字母代码表示核苷酸序列(DNA、RNA)和氨基酸蛋白质序列。

将 FASTA 转换为 GENBANK

免费的浏览器端 FASTA 转 GENBANK 转换器。在您的设备上即时转换文件。

检查与元数据

操作系统和文件分析器通过检查开头的二进制字节序列来识别 FASTA 文件:

选择或将文件拖放到此处

100% 浏览器端私密转换 - 文件绝不会离开您的设备

或粘贴 Ctrl+V
零网络传输隐私保证: 上传至外部服务器的数据为 0 字节。所有处理均在您的浏览器沙箱中本地完成。

字节级文件头签名 (Magic Bytes)

操作系统和文件分析器通过检查开头的二进制字节序列来识别 FASTA 文件:

十六进制签名 (偏移量 0):

3E

ASCII 表示形式: >

标准化: Bioinformatics de facto global standard

技术规格

容器架构Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
压缩方式Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
字节序ASCII / UTF-8 text stream
色彩空间N/A (Genomic Sequence Data)
通道与结构Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
最大尺寸Unbounded sequence length (supports entire human chromosomes over 250 million base pairs)
透明度None
流式传输与渐进式加载Sequential record-by-record streaming processing

技术对比矩阵:FASTA 对比同类产品

技术属性FASTA (当前)FASTQGENBANKGFF
质量分数无(纯序列字母)每个碱基的 Phred 质量分数无(特征注释)无(特征坐标)
标头行以 '>' 字符开头以 '@' 字符开头结构化的 LOCUS 块制表符分隔的基因组列
主要用途参考基因组与 BLAST 搜索原始高通量测序仪(Illumina)全面的注释基因基因组特征注释
文件大小(人类)未压缩约 3 吉字节约 100+ 吉字节(带质量分数)数吉字节的富文本约 50 兆字节

常见损坏模式与十六进制恢复指南

生物信息学工具报告"第 X 行序列字符无效"。

根本原因: 序列行内包含空格、数字或非 IUPAC 字符。

恢复方法: 使用 File2File 生物信息学工具过滤和清理序列字符。

安全分析与解析器攻击向量

基因组工具解析庞大的多吉字节 FASTA 文件时,在索引序列坐标时可能会发生整数溢出。

已知攻击向量

  • 超过 2^31 个碱基对的 32 位序列索引器 (FAI) 发生整数溢出。
  • 读取过长的序列标识符标头时发生缓冲区溢出。
  • 通过畸形比对查询实施拒绝服务攻击。

防御性最佳实践:

历史渊源与里程碑

2003人类基因组计划完成人类基因组的首次测序,并以 FASTA 格式发布结果。
1990BLAST(基本局部比对搜索工具)采用 FASTA 作为其标准输入格式。
1985William Pearson 和 David Lipman 随 FASTP 序列比对软件一起引入了 FASTA。

核心优势与特点

  • 计算生物学无可争议的全球标准:被地球上的每个基因组工具、测序仪和数据库使用。
  • 极致简洁:第 1 行以 '>' 开头,后跟一个标识符,接着是纯文本遗传字母。
  • 多序列容量:单个文件可以包含数千个独立基因或完整的病毒基因组。

技术局限与劣势

  • 不包含测序质量分数(不同于 FASTQ,后者存储每个碱基的 Phred 置信度分数)。
  • 除初始标识符外,标头行没有标准化的元数据语法。
  • 如果没有 Gzip 或专门的基因组压缩,全基因组数据集的存储占用巨大。

趣味技术冷知识

  • 整个包含 30 亿碱基对的人类基因组可以用 FASTA 格式表示,占用约 3 吉字节的存储空间。
  • 存储在 FASTA 文件中的 DNA 四个字母是 A(腺嘌呤)、C(胞嘧啶)、G(鸟嘌呤)和 T(胸腺嘧啶)。
  • 2020 年 1 月首次测序 COVID-19 冠状病毒基因组时,科学家们将其作为一个 3 万个字母的 FASTA 文件在全球共享。

常见技术问题

什么是 FASTA 文件?

FASTA 文件是生物学中使用的纯文本文件,用于通过单字母缩写存储 DNA、RNA 或蛋白质序列。

FASTA 和 FASTQ 有什么区别?

FASTA 仅存储基因序列字母,而 FASTQ 既存储字母,又存储每个碱基的测序准确度质量分数。

如何查看 FASTA 文件?

您可以在任何文本编辑器中打开 FASTA 文件,在 Jalview 或 UGENE 等生物信息学软件中查看它们,或者使用 File2File.app 进行转换。