Sekuens FASTA (.fasta)
Bioinformatics StandarFASTA adalah format file fondasi bioinformatics dan genomik yang ada di mana-mana, yang merepresentasikan sekuens nukleotida (DNA, RNA) dan sekuens protein asam amino menggunakan kode huruf tunggal universal.
Konversi FASTA ke GENBANK
Pengonversi FASTA ke GENBANK gratis di dalam peramban. Konversi berkas secara instan di perangkat Anda.
Periksa & Metadata
Sistem operasi dan penganalisis file mengidentifikasi file FASTA dengan memeriksa urutan byte biner utama:
Tanda Tangan Header Tingkat-Byte (Magic Bytes)
Sistem operasi dan penganalisis file mengidentifikasi file FASTA dengan memeriksa urutan byte biner utama:
SIGNATURE HEX (OFFSET 0):
3EREPRESENTASI ASCII: >
Standardisasi: Bioinformatics de facto global standard
Spesifikasi Teknis
| Arsitektur Wadah | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Kompresi | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Endianness Byte | ASCII / UTF-8 text stream |
| Ruang Warna | N/A (Genomic Sequence Data) |
| Saluran & Struktur | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Dimensi Maks | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Transparansi | None |
| Streaming & Progresif | Sequential record-by-record streaming processing |
Matriks Perbandingan Teknis: FASTA vs Pesaing
| Atribut Teknis | FASTA (Saat Ini) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Skor Kualitas | Tidak ada (huruf sekuens murni) | Skor kualitas Phred per basa | Tidak ada (anotasi fitur) | Tidak ada (koordinat fitur) |
| Baris Header | Dimulai dengan karakter '>' | Dimulai dengan karakter '@' | Blok LOCUS terstruktur | Kolom genomik dibatasi tab |
| Penggunaan Utama | Genom referensi & pencarian BLAST | Alat pengurutan throughput tinggi mentah (Illumina) | Gen beranotasi komprehensif | Anotasi fitur genomik |
| Ukuran File (Manusia) | ~3 Gigabita tidak terkompresi | ~100+ Gigabita (dengan kualitas) | Teks kaya berukuran multi-gigabita | ~50 Megabita |
Mode Kerusakan Umum & Panduan Pemulihan Hex
Alat bioinformatics melaporkan 'Karakter sekuens tidak valid pada baris X'.
Penyebab Utama: Spasi putih, angka, atau karakter non-IUPAC di dalam baris sekuens.
Pemulihan: Saring dan bersihkan karakter sekuens menggunakan File2File Bioinformatics Tool.
Analisis Keamanan & Vektor Serangan Parser
Alat genomik mengurai file FASTA berukuran multi-gigabyte masif di mana pelimpahan bilangan bulat (integer overflow) dapat terjadi saat mengindeks koordinat sekuens.
Vektor Serangan yang Diketahui
- Pelimpahan bilangan bulat pada pengindeks sekuens (FAI) 32-bit yang melebihi 2^31 pasangan basa.
- Pelimpahan penyangga saat membaca header pengidentifikasi sekuens yang terlalu panjang.
- Penolakan layanan melalui kueri penyejajaran yang tidak normal.
Praktik Terbaik Defensif:
Asal-Usul & Tonggak Sejarah
Keunggulan & Kelebihan Utama
- Standar global biologi komputasi yang tidak terbantahkan: digunakan oleh setiap alat genomik, alat pengurutan (sequencer), dan basis data di Bumi.
- Kesederhanaan yang ekstrem: baris 1 dimulai dengan '>' diikuti oleh ID, lalu diikuti oleh huruf genetik teks biasa.
- Kapasitas multi-sekuens: satu file tunggal dapat berisi ribuan gen individual atau genom virus lengkap.
Keterbatasan Teknis & Kekurangan
- Tidak berisi skor kualitas pengurutan (tidak seperti FASTQ, yang menyimpan skor keyakinan Phred per basa).
- Tidak ada sintaks metadata standar untuk baris header di luar pengidentifikasi awal.
- Jejak penyimpanan yang sangat besar untuk kumpulan data genom utuh tanpa Gzip atau kompresi genomik khusus.
Fakta Teknis Menarik
- Seluruh genom manusia yang terdiri dari 3 miliar pasangan basa dapat direpresentasikan dalam format FASTA, yang memakan penyimpanan sekitar 3 gigabita.
- Empat huruf DNA yang disimpan dalam file FASTA adalah A (Adenin), C (Sitosin), G (Guanin), dan T (Timin).
- Saat genom virus korona COVID-19 pertama kali diurutkan pada Januari 2020, para ilmuwan membagikannya secara global sebagai file FASTA 30.000 huruf.
Pertanyaan Teknis yang Sering Diajukan
Apa itu file FASTA?
File FASTA adalah file teks biasa yang digunakan dalam biologi untuk menyimpan sekuens DNA, RNA, atau protein menggunakan singkatan satu huruf.
Apa perbedaan antara FASTA dan FASTQ?
FASTA hanya menyimpan huruf sekuens genetik, sedangkan FASTQ menyimpan huruf sekaligus skor kualitas keakuratan pengurutan (sequencing) untuk setiap basa.
Bagaimana cara melihat file FASTA?
Anda dapat membuka file FASTA di editor teks apa pun, melihatnya di perangkat lunak bioinformatika seperti Jalview atau UGENE, atau mengonversinya menggunakan File2File.app.
Pasangan Konversi FASTA Terkait
Mengubah urutan FASTA biasa menjadi GenBank flatfile menambahkan anotasi biologis penting dan metadata ke kode genetik mentah.
Mengubah GenBank Flatfile menjadi Urutan FASTA menghapus metadata anotasi untuk menyisakan hanya urutan nukleotida atau asam amino mentah yang diperlukan untuk analisis bioinformatika yang cepat.