FASTA अनुक्रम (.fasta)

Bioinformatics मानक

FASTA जैव सूचना विज्ञान और जीनोमिक्स का सर्वव्यापी, मूलभूत फ़ाइल प्रारूप है, जो सार्वभौमिक एकल-अक्षर कोड का उपयोग करके न्यूक्लियोटाइड अनुक्रमों (DNA, RNA) और अमीनो एसिड प्रोटीन अनुक्रमों का प्रतिनिधित्व करता है।

FASTA को GENBANK में कन्वर्ट करें

मुफ्त इन-ब्राउज़र FASTA से GENBANK कन्वर्टर। अपने डिवाइस पर तुरंत फ़ाइलें कन्वर्ट करें।

इंस्पेक्ट और मेटाडेटा

ऑपरेटिंग सिस्टम और फ़ाइल विश्लेषक शुरुआती बाइनरी बाइट अनुक्रम का निरीक्षण करके FASTA फ़ाइलों की पहचान करते हैं:

फ़ाइलें यहाँ चुनें या छोड़ें

100% प्राइवेट इन-ब्राउज़र कन्वर्शन - फ़ाइलें कभी आपका डिवाइस नहीं छोड़तीं

या पेस्ट करें Ctrl+V
शून्य-नेटवर्क-ट्रांसमिशन गोपनीयता गारंटी: बाहरी सर्वर पर 0 बाइट अपलोड किए गए। सारी प्रोसेसिंग आपके ब्राउज़र सैन्डबॉक्स में स्थानीय रूप से हुई।

बाइट-स्तरीय हेडर हस्ताक्षर (मैजिक बाइट्स)

ऑपरेटिंग सिस्टम और फ़ाइल विश्लेषक शुरुआती बाइनरी बाइट अनुक्रम का निरीक्षण करके FASTA फ़ाइलों की पहचान करते हैं:

HEX हस्ताक्षर (ऑफ़सेट 0):

3E

ASCII निरूपण: >

मानकीकरण: Bioinformatics de facto global standard

तकनीकी विनिर्देश

कंटेनर आर्किटेक्चरPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
कंप्रेशनUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
बाइट एंडियानेसASCII / UTF-8 text stream
कलर स्पेसN/A (Genomic Sequence Data)
चैनल और संरचनाNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
अधिकतम आयामUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
पारदर्शिता (Transparency)None
स्ट्रीमिंग और प्रोग्रेसिवSequential record-by-record streaming processing

तकनीकी तुलना मैट्रिक्स: FASTA बनाम प्रतियोगी

तकनीकी विशेषताFASTA (वर्तमान)FASTQGENBANKGFF
गुणवत्ता स्कोरकोई नहीं (शुद्ध अनुक्रम अक्षर)प्रति-बेस Phred गुणवत्ता स्कोरकोई नहीं (सुविधा एनोटेशन)कोई नहीं (सुविधा निर्देशांक)
हेडर लाइन'>' वर्ण से शुरू होती है'@' वर्ण से शुरू होती हैसंरचित LOCUS ब्लॉकटैब-सीमांकित जीनोमिक कॉलम
प्राथमिक उपयोगसंदर्भ जीनोम और BLAST खोजकच्चे उच्च-थ्रूपुट सीक्वेसर (Illumina)व्यापक एनोटेट जीनजीनोमिक विशेषता एनोटेशन
फ़ाइल आकार (मानव)~3 गीगाबाइट असम्पीडित~100+ गीगाबाइट (गुणों के साथ)बहु-गीगाबाइट समृद्ध पाठ~50 मेगाबाइट

सामान्य करप्शन मोड और हेक्स रिकवरी गाइड

जैव सूचना विज्ञान टूल रिपोर्ट करता है 'पंक्ति X पर अमान्य अनुक्रम वर्ण'।

मूल कारण: अनुक्रम पंक्तियों के अंदर व्हाइटस्पेस, संख्याएँ या गैर-IUPAC वर्ण।

रिकवरी: File2File Bioinformatics Tool का उपयोग करके अनुक्रम वर्णों को फ़िल्टर और साफ़ करें।

सुरक्षा विश्लेषण और पार्सर अटैक वेक्टर्स

जीनोमिक्स टूल विशाल बहु-गीगाबाइट FASTA फ़ाइलों को पार्स करते हैं जहाँ अनुक्रम निर्देशांक अनुक्रमण करते समय पूर्णांक ओवरफ्लो हो सकते हैं।

ज्ञात अटैक वेक्टर्स

  • 32-बिट अनुक्रम इंडेक्सर्स (FAI) में पूर्णांक ओवरफ्लो जो 2^31 बेस पेयर से अधिक है।
  • अत्यधिक लंबे अनुक्रम पहचानकर्ता हेडर पढ़ते समय बफर ओवरफ्लो।
  • पैथोलॉजिकल संरेखण प्रश्नों के माध्यम से सेवा से इनकार।

सुरक्षात्मक सर्वोत्तम प्रथाएँ:

ऐतिहासिक मूल और मील के पत्थर

2003मानव जीनोम परियोजना मानव जीनोम का पहला अनुक्रमण पूरा करती है, परिणाम FASTA प्रारूप में प्रकाशित करती है।
1990BLAST (Basic Local Alignment Search Tool) FASTA को अपने मानक इनपुट प्रारूप के रूप में अपनाता है।
1985विलियम पियरसन और डेविड लिपमैन FASTP अनुक्रम संरेखण सॉफ्टवेयर के साथ FASTA पेश करते हैं।

मुख्य लाभ और खूबियाँ

  • कंप्यूटेशनल जीव विज्ञान का निर्विवाद वैश्विक मानक: पृथ्वी पर हर जीनोमिक टूल, सीक्वेसर और डेटाबेस द्वारा उपयोग किया जाता है।
  • अत्यंत सरलता: पंक्ति 1 '>' से शुरू होती है जिसके बाद एक आईडी होती है, जिसके बाद सादे पाठ आनुवंशिक अक्षर होते हैं।
  • बहु-अनुक्रम क्षमता: एक ही फ़ाइल में हज़ारों व्यक्तिगत जीन या पूर्ण वायरल जीनोम हो सकते हैं।

तकनीकी सीमाएँ और कमियाँ

  • कोई अनुक्रमण गुणवत्ता स्कोर नहीं होता है (FASTQ के विपरीत, जो प्रति-बेस Phred विश्वास स्कोर संग्रहीत करता है)।
  • प्रारंभिक पहचानकर्ता से परे हेडर लाइनों के लिए कोई मानकीकृत मेटाडेटा सिंटैक्स नहीं है।
  • Gzip या विशेष जीनोमिक संपीड़न के बिना पूर्ण-जीनोम डेटासेट के लिए भारी भंडारण पदचिह्न।

रोचक तकनीकी जानकारी

  • संपूर्ण 3-अरब-बेस-पेयर मानव जीनोम को FASTA प्रारूप में दर्शाया जा सकता है, जिसमें लगभग 3 गीगाबाइट भंडारण की आवश्यकता होती है।
  • FASTA फ़ाइलों में संग्रहीत DNA के चार अक्षर A (Adenine), C (Cytosine), G (Guanine) और T (Thymine) हैं।
  • जब जनवरी 2020 में COVID-19 कोरोनावायरस जीनोम को पहली बार अनुक्रमित किया गया था, तो वैज्ञानिकों ने इसे विश्व स्तर पर 30,000-अक्षर वाली FASTA फ़ाइल के रूप में साझा किया था।

अक्सर पूछे جانے वाले तकनीकी प्रश्न

FASTA फ़ाइल क्या है?

FASTA फ़ाइल जीव विज्ञान में एकल-अक्षर संक्षिप्त रूपों का उपयोग करके DNA, RNA, या प्रोटीन अनुक्रमों (sequences) को स्टोर करने के लिए उपयोग की जाने वाली एक सादी टेक्स्ट फ़ाइल है।

FASTA और FASTQ में क्या अंतर है?

FASTA केवल आनुवंशिक अनुक्रम अक्षरों को स्टोर करता है, जबकि FASTQ प्रत्येक बेस के लिए अक्षरों और अनुक्रमण सटीकता गुणवत्ता स्कोर दोनों को स्टोर करता है।

मैं FASTA फ़ाइल कैसे देख सकता हूँ?

आप किसी भी टेक्स्ट एडिटर में FASTA फाइलें खोल सकते हैं, Jalview या UGENE जैसे बायोइन्फॉर्मेटिक्स सॉफ्टवेयर में उन्हें देख सकते हैं, या File2File.app का उपयोग करके उन्हें बदल सकते हैं।