FASTA 序列 (.fasta)
Bioinformatics 标准FASTA 是生物信息学和基因 Genomics 领域无处不在的基石文件格式,使用通用的单字母代码表示核苷酸序列(DNA、RNA)和氨基酸蛋白质序列。
将 FASTA 转换为 GENBANK
免费的浏览器端 FASTA 转 GENBANK 转换器。在您的设备上即时转换文件。
检查与元数据
操作系统和文件分析器通过检查开头的二进制字节序列来识别 FASTA 文件:
字节级文件头签名 (Magic Bytes)
操作系统和文件分析器通过检查开头的二进制字节序列来识别 FASTA 文件:
十六进制签名 (偏移量 0):
3EASCII 表示形式: >
标准化: Bioinformatics de facto global standard
技术规格
| 容器架构 | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| 压缩方式 | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| 字节序 | ASCII / UTF-8 text stream |
| 色彩空间 | N/A (Genomic Sequence Data) |
| 通道与结构 | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| 最大尺寸 | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| 透明度 | None |
| 流式传输与渐进式加载 | Sequential record-by-record streaming processing |
技术对比矩阵:FASTA 对比同类产品
| 技术属性 | FASTA (当前) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| 质量分数 | 无(纯序列字母) | 每个碱基的 Phred 质量分数 | 无(特征注释) | 无(特征坐标) |
| 标头行 | 以 '>' 字符开头 | 以 '@' 字符开头 | 结构化的 LOCUS 块 | 制表符分隔的基因组列 |
| 主要用途 | 参考基因组与 BLAST 搜索 | 原始高通量测序仪(Illumina) | 全面的注释基因 | 基因组特征注释 |
| 文件大小(人类) | 未压缩约 3 吉字节 | 约 100+ 吉字节(带质量分数) | 数吉字节的富文本 | 约 50 兆字节 |
常见损坏模式与十六进制恢复指南
生物信息学工具报告"第 X 行序列字符无效"。
根本原因: 序列行内包含空格、数字或非 IUPAC 字符。
恢复方法: 使用 File2File 生物信息学工具过滤和清理序列字符。
安全分析与解析器攻击向量
基因组工具解析庞大的多吉字节 FASTA 文件时,在索引序列坐标时可能会发生整数溢出。
已知攻击向量
- 超过 2^31 个碱基对的 32 位序列索引器 (FAI) 发生整数溢出。
- 读取过长的序列标识符标头时发生缓冲区溢出。
- 通过畸形比对查询实施拒绝服务攻击。
防御性最佳实践:
历史渊源与里程碑
2003人类基因组计划完成人类基因组的首次测序,并以 FASTA 格式发布结果。
1990BLAST(基本局部比对搜索工具)采用 FASTA 作为其标准输入格式。
1985William Pearson 和 David Lipman 随 FASTP 序列比对软件一起引入了 FASTA。
核心优势与特点
- 计算生物学无可争议的全球标准:被地球上的每个基因组工具、测序仪和数据库使用。
- 极致简洁:第 1 行以 '>' 开头,后跟一个标识符,接着是纯文本遗传字母。
- 多序列容量:单个文件可以包含数千个独立基因或完整的病毒基因组。
技术局限与劣势
- 不包含测序质量分数(不同于 FASTQ,后者存储每个碱基的 Phred 置信度分数)。
- 除初始标识符外,标头行没有标准化的元数据语法。
- 如果没有 Gzip 或专门的基因组压缩,全基因组数据集的存储占用巨大。
趣味技术冷知识
- 整个包含 30 亿碱基对的人类基因组可以用 FASTA 格式表示,占用约 3 吉字节的存储空间。
- 存储在 FASTA 文件中的 DNA 四个字母是 A(腺嘌呤)、C(胞嘧啶)、G(鸟嘌呤)和 T(胸腺嘧啶)。
- 2020 年 1 月首次测序 COVID-19 冠状病毒基因组时,科学家们将其作为一个 3 万个字母的 FASTA 文件在全球共享。
常见技术问题
什么是 FASTA 文件?
FASTA 文件是生物学中使用的纯文本文件,用于通过单字母缩写存储 DNA、RNA 或蛋白质序列。
FASTA 和 FASTQ 有什么区别?
FASTA 仅存储基因序列字母,而 FASTQ 既存储字母,又存储每个碱基的测序准确度质量分数。
如何查看 FASTA 文件?
您可以在任何文本编辑器中打开 FASTA 文件,在 Jalview 或 UGENE 等生物信息学软件中查看它们,或者使用 File2File.app 进行转换。