ลำดับ FASTA (.fasta)
Bioinformatics มาตรฐานFASTA คือรูปแบบไฟล์พื้นฐานที่แพร่หลายที่สุดในชีวสารสนเทศศาสตร์และจีโนมิกส์ โดยใช้แทนลำดับนิวคลีโอไทด์ (DNA, RNA) และลำดับกรดอะมิโนของโปรตีนด้วยรหัสตัวอักษรเดี่ยวสากล
แปลง FASTA เป็น GENBANK
ตัวแปลงจาก FASTA เป็น GENBANK ฟรีในเบราว์เซอร์ แปลงไฟล์ได้ทันทีบนอุปกรณ์ของคุณ
ตรวจสอบและดู Metadata
ระบบปฏิบัติการและเครื่องมือวิเคราะห์ไฟล์จะระบุไฟล์ FASTA โดยการตรวจสอบลำดับไบต์ไบนารีส่วนต้น:
ลายเซ็นส่วนหัวในระดับไบต์ (Magic Bytes)
ระบบปฏิบัติการและเครื่องมือวิเคราะห์ไฟล์จะระบุไฟล์ FASTA โดยการตรวจสอบลำดับไบต์ไบนารีส่วนต้น:
ลายเซ็น HEX (OFFSET 0):
3Eการแสดงผลรูปแบบ ASCII: >
มาตรฐาน: Bioinformatics de facto global standard
ข้อมูลจำเพาะทางเทคนิค
| สถาปัตยกรรมคอนเทนเนอร์ | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| การบีบอัด | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| การจัดลำดับไบต์ (Byte Endianness) | ASCII / UTF-8 text stream |
| พื้นที่สี | N/A (Genomic Sequence Data) |
| ช่องสัญญาณและโครงสร้าง | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| ขนาดสูงสุด | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| ความโปร่งใส | None |
| การสตรีมและแบบโปรเกรสซีฟ | Sequential record-by-record streaming processing |
ตารางเปรียบเทียบทางเทคนิค: FASTA กับคู่แข่ง
| คุณลักษณะทางเทคนิค | FASTA (ปัจจุบัน) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| คะแนนคุณภาพ | ไม่มี (ตัวอักษรลำดับเพียวๆ) | คะแนนคุณภาพ Phred สำหรับแต่ละเบส | ไม่มี (คำอธิบายประกอบคุณลักษณะ) | ไม่มี (พิกัดคุณลักษณะ) |
| บรรทัดส่วนหัว | เริ่มต้นด้วยอักขระ '>' | เริ่มต้นด้วยอักขระ '@' | บล็อก LOCUS ที่มีโครงสร้าง | คอลัมน์จีโนมคั่นด้วยแท็บ |
| การใช้งานหลัก | จีโนม้างอิงและการค้นหา BLAST | เครื่องซีเควนเซอร์ปริมาณงานสูงแบบดิบ (Illumina) | ยีนที่มีการใส่คำอธิบายประกอบครบถ้วน | คำอธิบายประกอบคุณลักษณะจีโนม |
| ขนาดไฟล์ (ของมนุษย์) | ~3 กิกะไบต์ (ยังไม่บีบอัด) | ~100+ กิกะไบต์ (รวมค่าคุณภาพ) | ข้อความสมบูรณ์หลายกิกะไบต์ | ~50 เมกะไบต์ |
รูปแบบความเสียหายทั่วไปและคู่มือการกู้คืน Hex
เครื่องมือชีวสารสนเทศรายงานว่า 'อักขระลำดับไม่ถูกต้องที่บรรทัด X'
สาเหตุหลัก: มีช่องว่าง ตัวเลข หรืออักขระที่ไม่ใช่ IUPAC อยู่ในบรรทัดลำดับ
การกู้คืน: กรองและทำความสะอาดอักขระลำดับโดยใช้เครื่องมือชีวสารสนเทศ File2File
การวิเคราะห์ความปลอดภัยและเวกเตอร์การโจมตีตัวแยกวิเคราะห์
เครื่องมือจีโนมิกส์วิเคราะห์ไฟล์ FASTA ขนาดใหญ่ระดับหลายกิกะไบต์ ซึ่งอาจเกิดปัญหา integer overflow เมื่อทำการจัดทำดัชนีพิกัดลำดับ
เวกเตอร์การโจมตีที่ทราบ
- Integer overflow ในเครื่องมือจัดทำดัชนีลำดับ 32-บิต (FAI) ที่เกิน 2^31 คู่เบส
- Buffer overflow เมื่ออ่านส่วนหัวตัวระบุลำดับที่ยาวเกินไป
- การปฏิเสธการให้บริการ (Denial of Service) ผ่านทางการสืบค้นการจัดเรียงลำดับที่ผิดปกติ
แนวทางปฏิบัติที่ดีที่สุดในการป้องกัน:
ประวัติความเป็นมาและเหตุการณ์สำคัญ
ข้อได้เปรียบและจุดเด่นสำคัญ
- มาตรฐานระดับโลกที่ไม่มีใครโต้แย้งสำหรับชีววิทยาเชิงคำนวณ: ใช้โดยเครื่องมือจีโนม เครื่องซีเควนเซอร์ และฐานข้อมูลทุกแห่งบนโลก
- ความเรียบง่ายขั้นสุด: บรรทัดที่ 1 เริ่มต้นด้วยเครื่องหมาย '>' ตามด้วยรหัสระบุ และตามด้วยตัวอักษรทางพันธุศาสตร์ที่เป็นข้อความธรรมดา
- ความสามารถในการเก็บหลายลำดับ: ไฟล์เดียวสามารถบรรจุยีนนับพันตัวหรือจีโนมไวรัสที่สมบูรณ์ได้
ข้อจำกัดทางเทคนิคและข้อควรพิจารณา
- ไม่มีคะแนนคุณภาพการอ่านลำดับ (แตกต่างจาก FASTQ ที่จัดเก็บคะแนนความเชื่อมั่น Phred ในแต่ละเบส)
- ไม่มีไวยากรณ์เมทาดาทาที่เป็นมาตรฐานสำหรับบรรทัดส่วนหัวนอกเหนือจากตัวระบุเริ่มต้น
- พื้นที่จัดเก็บมหาศาลสำหรับชุดข้อมูลจีโนมทั้งชุดหากไม่มีการบีบอัดแบบ Gzip หรือการบีบอัดจีโนมเฉพาะทาง
เกร็ดความรู้ทางเทคนิคที่น่าสนใจ
- จีโนมมนุษย์ที่มีคู่เบส 3 พันล้านคู่ทั้งหมด สามารถแทนที่ได้ในรูปแบบ FASTA โดยใช้พื้นที่จัดเก็บประมาณ 3 กิกะไบต์
- ตัวอักษร 4 ตัวของ DNA ที่เก็บไว้ในไฟล์ FASTA ได้แก่ A (Adenine), C (Cytosine), G (Guanine) และ T (Thymine)
- เมื่อจีโนมไวรัสโคโรนา COVID-19 ถูกถอดรหัสเป็นครั้งแรกในเดือนมกราคม 2020 นักวิทยาศาสตร์ได้แบ่งปันทั่วโลกในรูปแบบไฟล์ FASTA ขนาด 30,000 ตัวอักษร
คำถามทางเทคนิคที่พบบ่อย
ไฟล์ FASTA คืออะไร
ไฟล์ FASTA คือไฟล์ข้อความธรรมดาที่ใช้ในชีววิทยาเพื่อจัดเก็บลำดับ DNA, RNA หรือโปรตีนโดยใช้อักษรย่อตัวเดียว
ความแตกต่างระหว่าง FASTA และ FASTQ คืออะไร
FASTA จัดเก็บเฉพาะตัวอักษรลำดับทางพันธุกรรมเท่านั้น ในขณะที่ FASTQ จัดเก็บทั้งตัวอักษรและคะแนนคุณภาพความถูกต้องของการจัดลำดับสำหรับแต่ละเบส
ฉันจะดูไฟล์ FASTA ได้อย่างไร
คุณสามารถเปิดไฟล์ FASTA ในโปรแกรมแก้ไขข้อความใดก็ได้, ดูในซอฟต์แวร์ชีวสารสนเทศเช่น Jalview หรือ UGENE หรือแปลงไฟล์โดยใช้ File2File.app
คู่การแปลงไฟล์ FASTA ที่เกี่ยวข้อง
การแปลงลำดับ FASTA ธรรมดาให้เป็นไฟล์ GenBank flatfile จะช่วยเพิ่มข้อมูลประกอบทางชีวภาพและข้อมูลเมตาที่จำเป็นให้กับรหัสพันธุกรรมดิบ
การแปลง GenBank Flatfile เป็นลำดับ FASTA จะช่วยตัดข้อมูลเมตาคำอธิบายประกอบออกไป เหลือไว้เพียงลำดับนิวคลีโอไทด์หรือกรดอะมิโนดิบที่จำเป็นสำหรับการวิเคราะห์ทางชีวสารสนเทศที่รวดเร็ว