Sekuens FASTA (.fasta)

Bioinformatics Standar

FASTA adalah format file fondasi bioinformatics dan genomik yang ada di mana-mana, yang merepresentasikan sekuens nukleotida (DNA, RNA) dan sekuens protein asam amino menggunakan kode huruf tunggal universal.

Konversi FASTA ke GENBANK

Pengonversi FASTA ke GENBANK gratis di dalam peramban. Konversi berkas secara instan di perangkat Anda.

Periksa & Metadata

Sistem operasi dan penganalisis file mengidentifikasi file FASTA dengan memeriksa urutan byte biner utama:

Pilih atau letakkan berkas di sini

100% konversi privat di dalam peramban - berkas tidak pernah meninggalkan perangkat Anda

atau tempel Ctrl+V
Jaminan Privasi Tanpa Transmisi Jaringan: 0 byte diunggah ke server eksternal. Semua pemrosesan terjadi secara lokal di sandboks peramban Anda.

Tanda Tangan Header Tingkat-Byte (Magic Bytes)

Sistem operasi dan penganalisis file mengidentifikasi file FASTA dengan memeriksa urutan byte biner utama:

SIGNATURE HEX (OFFSET 0):

3E

REPRESENTASI ASCII: >

Standardisasi: Bioinformatics de facto global standard

Spesifikasi Teknis

Arsitektur WadahPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompresiUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Endianness ByteASCII / UTF-8 text stream
Ruang WarnaN/A (Genomic Sequence Data)
Saluran & StrukturNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Dimensi MaksUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TransparansiNone
Streaming & ProgresifSequential record-by-record streaming processing

Matriks Perbandingan Teknis: FASTA vs Pesaing

Atribut TeknisFASTA (Saat Ini)FASTQGENBANKGFF
Skor KualitasTidak ada (huruf sekuens murni)Skor kualitas Phred per basaTidak ada (anotasi fitur)Tidak ada (koordinat fitur)
Baris HeaderDimulai dengan karakter '>'Dimulai dengan karakter '@'Blok LOCUS terstrukturKolom genomik dibatasi tab
Penggunaan UtamaGenom referensi & pencarian BLASTAlat pengurutan throughput tinggi mentah (Illumina)Gen beranotasi komprehensifAnotasi fitur genomik
Ukuran File (Manusia)~3 Gigabita tidak terkompresi~100+ Gigabita (dengan kualitas)Teks kaya berukuran multi-gigabita~50 Megabita

Mode Kerusakan Umum & Panduan Pemulihan Hex

Alat bioinformatics melaporkan 'Karakter sekuens tidak valid pada baris X'.

Penyebab Utama: Spasi putih, angka, atau karakter non-IUPAC di dalam baris sekuens.

Pemulihan: Saring dan bersihkan karakter sekuens menggunakan File2File Bioinformatics Tool.

Analisis Keamanan & Vektor Serangan Parser

Alat genomik mengurai file FASTA berukuran multi-gigabyte masif di mana pelimpahan bilangan bulat (integer overflow) dapat terjadi saat mengindeks koordinat sekuens.

Vektor Serangan yang Diketahui

  • Pelimpahan bilangan bulat pada pengindeks sekuens (FAI) 32-bit yang melebihi 2^31 pasangan basa.
  • Pelimpahan penyangga saat membaca header pengidentifikasi sekuens yang terlalu panjang.
  • Penolakan layanan melalui kueri penyejajaran yang tidak normal.

Praktik Terbaik Defensif:

Asal-Usul & Tonggak Sejarah

2003Proyek Genom Manusia merampungkan pengurutan genom manusia yang pertama, dan menerbitkan hasilnya dalam format FASTA.
1990BLAST (Basic Local Alignment Search Tool) mengadopsi FASTA sebagai format masukan standarnya.
1985William Pearson dan David Lipman memperkenalkan FASTA bersama perangkat lunak penyejajaran sekuens FASTP.

Keunggulan & Kelebihan Utama

  • Standar global biologi komputasi yang tidak terbantahkan: digunakan oleh setiap alat genomik, alat pengurutan (sequencer), dan basis data di Bumi.
  • Kesederhanaan yang ekstrem: baris 1 dimulai dengan '>' diikuti oleh ID, lalu diikuti oleh huruf genetik teks biasa.
  • Kapasitas multi-sekuens: satu file tunggal dapat berisi ribuan gen individual atau genom virus lengkap.

Keterbatasan Teknis & Kekurangan

  • Tidak berisi skor kualitas pengurutan (tidak seperti FASTQ, yang menyimpan skor keyakinan Phred per basa).
  • Tidak ada sintaks metadata standar untuk baris header di luar pengidentifikasi awal.
  • Jejak penyimpanan yang sangat besar untuk kumpulan data genom utuh tanpa Gzip atau kompresi genomik khusus.

Fakta Teknis Menarik

  • Seluruh genom manusia yang terdiri dari 3 miliar pasangan basa dapat direpresentasikan dalam format FASTA, yang memakan penyimpanan sekitar 3 gigabita.
  • Empat huruf DNA yang disimpan dalam file FASTA adalah A (Adenin), C (Sitosin), G (Guanin), dan T (Timin).
  • Saat genom virus korona COVID-19 pertama kali diurutkan pada Januari 2020, para ilmuwan membagikannya secara global sebagai file FASTA 30.000 huruf.

Pertanyaan Teknis yang Sering Diajukan

Apa itu file FASTA?

File FASTA adalah file teks biasa yang digunakan dalam biologi untuk menyimpan sekuens DNA, RNA, atau protein menggunakan singkatan satu huruf.

Apa perbedaan antara FASTA dan FASTQ?

FASTA hanya menyimpan huruf sekuens genetik, sedangkan FASTQ menyimpan huruf sekaligus skor kualitas keakuratan pengurutan (sequencing) untuk setiap basa.

Bagaimana cara melihat file FASTA?

Anda dapat membuka file FASTA di editor teks apa pun, melihatnya di perangkat lunak bioinformatika seperti Jalview atau UGENE, atau mengonversinya menggunakan File2File.app.