ลำดับ FASTA (.fasta)

Bioinformatics มาตรฐาน

FASTA คือรูปแบบไฟล์พื้นฐานที่แพร่หลายที่สุดในชีวสารสนเทศศาสตร์และจีโนมิกส์ โดยใช้แทนลำดับนิวคลีโอไทด์ (DNA, RNA) และลำดับกรดอะมิโนของโปรตีนด้วยรหัสตัวอักษรเดี่ยวสากล

แปลง FASTA เป็น GENBANK

ตัวแปลงจาก FASTA เป็น GENBANK ฟรีในเบราว์เซอร์ แปลงไฟล์ได้ทันทีบนอุปกรณ์ของคุณ

ตรวจสอบและดู Metadata

ระบบปฏิบัติการและเครื่องมือวิเคราะห์ไฟล์จะระบุไฟล์ FASTA โดยการตรวจสอบลำดับไบต์ไบนารีส่วนต้น:

เลือกหรือวางไฟล์ที่นี่

การแปลงไฟล์แบบส่วนตัว 100% ในเบราว์เซอร์ - ไฟล์จะไม่ rời ออกจากอุปกรณ์ของคุณ

หรือวาง Ctrl+V
การรับประกันความเป็นส่วนตัวแบบไม่มีการส่งผ่านเครือข่าย: อัปโหลด 0 ไบต์ไปยังเซิร์ฟเวอร์ภายนอก การประมวลผลทั้งหมดเกิดขึ้นภายในแซนด์บ็อกซ์ของเบราว์เซอร์ของคุณ

ลายเซ็นส่วนหัวในระดับไบต์ (Magic Bytes)

ระบบปฏิบัติการและเครื่องมือวิเคราะห์ไฟล์จะระบุไฟล์ FASTA โดยการตรวจสอบลำดับไบต์ไบนารีส่วนต้น:

ลายเซ็น HEX (OFFSET 0):

3E

การแสดงผลรูปแบบ ASCII: >

มาตรฐาน: Bioinformatics de facto global standard

ข้อมูลจำเพาะทางเทคนิค

สถาปัตยกรรมคอนเทนเนอร์Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
การบีบอัดUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
การจัดลำดับไบต์ (Byte Endianness)ASCII / UTF-8 text stream
พื้นที่สีN/A (Genomic Sequence Data)
ช่องสัญญาณและโครงสร้างNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
ขนาดสูงสุดUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ความโปร่งใสNone
การสตรีมและแบบโปรเกรสซีฟSequential record-by-record streaming processing

ตารางเปรียบเทียบทางเทคนิค: FASTA กับคู่แข่ง

คุณลักษณะทางเทคนิคFASTA (ปัจจุบัน)FASTQGENBANKGFF
คะแนนคุณภาพไม่มี (ตัวอักษรลำดับเพียวๆ)คะแนนคุณภาพ Phred สำหรับแต่ละเบสไม่มี (คำอธิบายประกอบคุณลักษณะ)ไม่มี (พิกัดคุณลักษณะ)
บรรทัดส่วนหัวเริ่มต้นด้วยอักขระ '>'เริ่มต้นด้วยอักขระ '@'บล็อก LOCUS ที่มีโครงสร้างคอลัมน์จีโนมคั่นด้วยแท็บ
การใช้งานหลักจีโนม้างอิงและการค้นหา BLASTเครื่องซีเควนเซอร์ปริมาณงานสูงแบบดิบ (Illumina)ยีนที่มีการใส่คำอธิบายประกอบครบถ้วนคำอธิบายประกอบคุณลักษณะจีโนม
ขนาดไฟล์ (ของมนุษย์)~3 กิกะไบต์ (ยังไม่บีบอัด)~100+ กิกะไบต์ (รวมค่าคุณภาพ)ข้อความสมบูรณ์หลายกิกะไบต์~50 เมกะไบต์

รูปแบบความเสียหายทั่วไปและคู่มือการกู้คืน Hex

เครื่องมือชีวสารสนเทศรายงานว่า 'อักขระลำดับไม่ถูกต้องที่บรรทัด X'

สาเหตุหลัก: มีช่องว่าง ตัวเลข หรืออักขระที่ไม่ใช่ IUPAC อยู่ในบรรทัดลำดับ

การกู้คืน: กรองและทำความสะอาดอักขระลำดับโดยใช้เครื่องมือชีวสารสนเทศ File2File

การวิเคราะห์ความปลอดภัยและเวกเตอร์การโจมตีตัวแยกวิเคราะห์

เครื่องมือจีโนมิกส์วิเคราะห์ไฟล์ FASTA ขนาดใหญ่ระดับหลายกิกะไบต์ ซึ่งอาจเกิดปัญหา integer overflow เมื่อทำการจัดทำดัชนีพิกัดลำดับ

เวกเตอร์การโจมตีที่ทราบ

  • Integer overflow ในเครื่องมือจัดทำดัชนีลำดับ 32-บิต (FAI) ที่เกิน 2^31 คู่เบส
  • Buffer overflow เมื่ออ่านส่วนหัวตัวระบุลำดับที่ยาวเกินไป
  • การปฏิเสธการให้บริการ (Denial of Service) ผ่านทางการสืบค้นการจัดเรียงลำดับที่ผิดปกติ

แนวทางปฏิบัติที่ดีที่สุดในการป้องกัน:

ประวัติความเป็นมาและเหตุการณ์สำคัญ

2003โครงการจีโนมมนุษย์ (Human Genome Project) เสร็จสิ้นการจัดลำดับจีโนมมนุษย์ครั้งแรก และเผยแพร่ผลลัพธ์ในรูปแบบ FASTA
1990BLAST (Basic Local Alignment Search Tool) นำ FASTA มาใช้เป็นรูปแบบข้อมูลเข้าตรฐาน
1985William Pearson และ David Lipman เปิดตัว FASTA พร้อมกับซอฟต์แวร์จัดลำดับสายพันธุ์ FASTP

ข้อได้เปรียบและจุดเด่นสำคัญ

  • มาตรฐานระดับโลกที่ไม่มีใครโต้แย้งสำหรับชีววิทยาเชิงคำนวณ: ใช้โดยเครื่องมือจีโนม เครื่องซีเควนเซอร์ และฐานข้อมูลทุกแห่งบนโลก
  • ความเรียบง่ายขั้นสุด: บรรทัดที่ 1 เริ่มต้นด้วยเครื่องหมาย '>' ตามด้วยรหัสระบุ และตามด้วยตัวอักษรทางพันธุศาสตร์ที่เป็นข้อความธรรมดา
  • ความสามารถในการเก็บหลายลำดับ: ไฟล์เดียวสามารถบรรจุยีนนับพันตัวหรือจีโนมไวรัสที่สมบูรณ์ได้

ข้อจำกัดทางเทคนิคและข้อควรพิจารณา

  • ไม่มีคะแนนคุณภาพการอ่านลำดับ (แตกต่างจาก FASTQ ที่จัดเก็บคะแนนความเชื่อมั่น Phred ในแต่ละเบส)
  • ไม่มีไวยากรณ์เมทาดาทาที่เป็นมาตรฐานสำหรับบรรทัดส่วนหัวนอกเหนือจากตัวระบุเริ่มต้น
  • พื้นที่จัดเก็บมหาศาลสำหรับชุดข้อมูลจีโนมทั้งชุดหากไม่มีการบีบอัดแบบ Gzip หรือการบีบอัดจีโนมเฉพาะทาง

เกร็ดความรู้ทางเทคนิคที่น่าสนใจ

  • จีโนมมนุษย์ที่มีคู่เบส 3 พันล้านคู่ทั้งหมด สามารถแทนที่ได้ในรูปแบบ FASTA โดยใช้พื้นที่จัดเก็บประมาณ 3 กิกะไบต์
  • ตัวอักษร 4 ตัวของ DNA ที่เก็บไว้ในไฟล์ FASTA ได้แก่ A (Adenine), C (Cytosine), G (Guanine) และ T (Thymine)
  • เมื่อจีโนมไวรัสโคโรนา COVID-19 ถูกถอดรหัสเป็นครั้งแรกในเดือนมกราคม 2020 นักวิทยาศาสตร์ได้แบ่งปันทั่วโลกในรูปแบบไฟล์ FASTA ขนาด 30,000 ตัวอักษร

คำถามทางเทคนิคที่พบบ่อย

ไฟล์ FASTA คืออะไร

ไฟล์ FASTA คือไฟล์ข้อความธรรมดาที่ใช้ในชีววิทยาเพื่อจัดเก็บลำดับ DNA, RNA หรือโปรตีนโดยใช้อักษรย่อตัวเดียว

ความแตกต่างระหว่าง FASTA และ FASTQ คืออะไร

FASTA จัดเก็บเฉพาะตัวอักษรลำดับทางพันธุกรรมเท่านั้น ในขณะที่ FASTQ จัดเก็บทั้งตัวอักษรและคะแนนคุณภาพความถูกต้องของการจัดลำดับสำหรับแต่ละเบส

ฉันจะดูไฟล์ FASTA ได้อย่างไร

คุณสามารถเปิดไฟล์ FASTA ในโปรแกรมแก้ไขข้อความใดก็ได้, ดูในซอฟต์แวร์ชีวสารสนเทศเช่น Jalview หรือ UGENE หรือแปลงไฟล์โดยใช้ File2File.app