Trình tự FASTA (.fasta)

Bioinformatics Tiêu chuẩn

FASTA là định dạng tệp nền tảng, phổ biến trong sinh học thông tin và di a học, đại diện cho các trình tự nucleotide (DNA, RNA) và trình tự axit amin protein bằng cách sử dụng các mã đơn ký tự phổ quát.

Chuyển đổi FASTA sang GENBANK

Trình chuyển đổi từ FASTA sang GENBANK miễn phí trên trình duyệt. Chuyển đổi tệp ngay lập tức trên thiết bị của bạn.

Kiểm tra & Siêu dữ liệu

Các hệ điều hành và trình phân tích tệp nhận dạng tệp FASTA bằng cách kiểm tra chuỗi byte nhị phân đầu tệp:

Chọn hoặc thả tệp vào đây

Chuyển đổi 100% riêng tư trong trình duyệt - tệp không bao giờ rời khỏi thiết bị của bạn

hoặc dán Ctrl+V
Cam kết bảo mật không truyền tải qua mạng: 0 byte được tải lên máy chủ bên ngoài. Toàn bộ quá trình xử lý diễn ra cục bộ trong hộp cát trình duyệt của bạn.

Chữ ký tiêu đề ở cấp độ Byte (Magic Bytes)

Các hệ điều hành và trình phân tích tệp nhận dạng tệp FASTA bằng cách kiểm tra chuỗi byte nhị phân đầu tệp:

CHỮ KÝ HEX (OFFSET 0):

3E

BIỂU DIỄN ASCII: >

Tiêu chuẩn hóa: Bioinformatics de facto global standard

Thông số kỹ thuật

Kiến trúc ContainerPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
NénUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Thứ tự byte EndiannessASCII / UTF-8 text stream
Không gian màuN/A (Genomic Sequence Data)
Kênh & Cấu trúcNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Kích thước tối đaUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
Độ trong suốtNone
Truyền phát & Tăng dầnSequential record-by-record streaming processing

Ma trận so sánh kỹ thuật: FASTA so với các đối thủ

Thuộc tính kỹ thuậtFASTA (Hiện tại)FASTQGENBANKGFF
Điểm Chất lượngKhông có (chỉ các chữ cái trình tự thuần túy)Điểm chất lượng Phred trên mỗi cơ sởKhông có (chú thích tính năng)Không có (tọa độ tính năng)
Dòng Tiêu đềBắt đầu bằng ký tự '>'Bắt đầu bằng ký tự '@'Khối LOCUS có cấu trúcCác cột gen phân tách bằng tab
Mục đích ChínhBộ gen tham chiếu & tìm kiếm BLASTMáy giải trình tự thông lượng cao thô (Illumina)Gen có chú thích toàn diệnChú thích tính năng bộ gen
Kích thước Tệp (Người)~3 Gigabyte chưa nén~100+ Gigabyte (có chất lượng)Văn bản phong phú đa gigabyte~50 Megabyte

Các chế độ hỏng hóc phổ biến & Hướng dẫn khôi phục Hex

Công cụ sinh học thông tin báo lỗi 'Ký tự trình tự không hợp lệ tại dòng X'.

Nguyên nhân gốc rễ: Khoảng trắng, số hoặc ký tự không phải IUPAC bên trong các dòng trình tự.

Khắc phục: Lọc và làm sạch các ký tự trình tự bằng File2File Bioinformatics Tool.

Phân tích bảo mật & Các vectơ tấn công bộ phân tích cú pháp

Các công cụ di a học phân tích cú pháp các tệp FASTA đa gigabyte khổng lồ, nơi tình trạng tràn số nguyên có thể xảy ra khi lập chỉ mục tọa độ trình tự.

Các Véc-tơ Tấn công Đã biết

  • Tràn số nguyên trong trình lập chỉ mục trình tự 32-bit (FAI) vượt quá 2^31 cặp cơ sở.
  • Tràn bộ đệm khi đọc tiêu đề mã định danh trình tự quá dài.
  • Từ chối dịch vụ thông qua các truy vấn ghép nối bệnh lý.

Thực tiễn Tốt nhất về Phòng thủ:

Nguồn gốc lịch sử & Các cột mốc

2003Dự án Bộ gen Người hoàn thành việc giải trình tự đầu tiên bộ gen người, công bố kết quả ở định dạng FASTA.
1990BLAST (Công cụ Tìm kiếm Ghép nối Cục bộ Cơ bản) áp dụng FASTA làm định dạng đầu vào chuẩn của mình.
1985William Pearson và David Lipman giới thiệu FASTA cùng với phần mềm ghép nối trình tự FASTP.

Ưu điểm & Lợi ích chính

  • Tiêu chuẩn toàn cầu không thể tranh cãi của sinh học tính toán: được sử dụng bởi mọi công cụ bộ gen, máy giải trình tự và cơ sở dữ liệu trên Trái đất.
  • Độ đơn giản cực độ: dòng 1 bắt đầu bằng '>' theo sau là mã định danh, tiếp theo là các chữ cái di truyền dạng văn bản thuần túy.
  • Dung lượng đa trình tự: một tệp duy nhất có thể chứa hàng nghìn gen riêng lẻ hoặc bộ gen virus hoàn chỉnh.

Hạn chế & Nhược điểm kỹ thuật

  • Không chứa điểm chất lượng giải trình tự (không giống như FASTQ, lưu trữ điểm tin cậy Phred trên mỗi cơ sở).
  • Không có cú pháp siêu dữ liệu chuẩn hóa cho các dòng tiêu đề ngoài mã định danh ban đầu.
  • Dung lượng lưu trữ khổng lồ cho các tập dữ liệu toàn bộ bộ gen nếu không có Gzip hoặc nén gen chuyên dụng.

Thông tin kỹ thuật thú vị

  • Toàn bộ bộ gen người gồm 3 tỷ cặp cơ sở có thể được biểu diễn ở định dạng FASTA, chiếm khoảng 3 gigabyte dung lượng lưu trữ.
  • Bốn chữ cái của DNA được lưu trữ trong tệp FASTA là A (Adenine), C (Cytosine), G (Guanine) và T (Thymine).
  • Khi bộ gen virus corona COVID-19 được giải trình tự lần đầu tiên vào tháng 1 năm 2020, các nhà khoa học đã chia sẻ nó trên toàn cầu dưới dạng tệp FASTA 30.000 ký tự.

Các câu hỏi kỹ thuật thường gặp

Tệp FASTA là gì?

Tệp FASTA là một tệp văn bản thuần túy được sử dụng trong sinh học để lưu trữ các trình tự DNA, RNA hoặc protein bằng các chữ cái viết tắt.

Sự khác biệt giữa FASTA và FASTQ là gì?

FASTA chỉ lưu trữ các chữ cái trình tự di truyền, trong khi FASTQ lưu trữ cả các chữ cái và điểm chất lượng độ chính xác của trình tự cho từng base.

Làm thế nào để xem tệp FASTA?

Bạn có thể mở tệp FASTA trong bất kỳ trình soạn thảo văn bản nào, xem chúng trong phần mềm sinh học như Jalview hoặc UGENE, hoặc chuyển đổi chúng bằng File2File.app.