सादा पाठ (.txt)

ISO/IEC मानक

सादा पाठ फ़ाइल (TXT) डिजिटल कंप्यूटिंग और मानवीय सूचना भंडारण का सार्वभौमिक आधार है, जिसमें कच्चे, गैर-स्वरूपित वर्ण होते हैं जिन्हें अस्तित्व में मौजूद हर कंप्यूटर ऑपरेटिंग सिस्टम और प्रोग्रामिंग भाषा द्वारा पढ़ा जा सकता है।

SRT को TXT में कन्वर्ट करें

मुफ्त इन-ब्राउज़र SRT से TXT कन्वर्टर। अपने डिवाइस पर तुरंत फ़ाइलें कन्वर्ट करें।

इंस्पेक्ट और मेटाडेटा

ऑपरेटिंग सिस्टम और फ़ाइल विश्लेषक शुरुआती बाइनरी बाइट अनुक्रम का निरीक्षण करके TXT फ़ाइलों की पहचान करते हैं:

फ़ाइलें यहाँ चुनें या छोड़ें

100% प्राइवेट इन-ब्राउज़र कन्वर्शन - फ़ाइलें कभी आपका डिवाइस नहीं छोड़तीं

या पेस्ट करें Ctrl+V
शून्य-नेटवर्क-ट्रांसमिशन गोपनीयता गारंटी: बाहरी सर्वर पर 0 बाइट अपलोड किए गए। सारी प्रोसेसिंग आपके ब्राउज़र सैन्डबॉक्स में स्थानीय रूप से हुई।

बाइट-स्तरीय हेडर हस्ताक्षर (मैजिक बाइट्स)

ऑपरेटिंग सिस्टम और फ़ाइल विश्लेषक शुरुआती बाइनरी बाइट अनुक्रम का निरीक्षण करके TXT फ़ाइलों की पहचान करते हैं:

HEX हस्ताक्षर (ऑफ़सेट 0):

EF BB BF / None

ASCII निरूपण: UTF-8 BOM / Raw text

मानकीकरण: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046

तकनीकी विनिर्देश

कंटेनर आर्किटेक्चरSequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859
कंप्रेशनUncompressed raw character bytes
बाइट एंडियानेसUTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32
कलर स्पेसN/A (Plaintext)
चैनल और संरचनाLinear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace
अधिकतम आयामUnbounded stream length
पारदर्शिता (Transparency)None
स्ट्रीमिंग और प्रोग्रेसिवUniversal immediate byte-by-byte streaming

तकनीकी तुलना मैट्रिक्स: TXT बनाम प्रतियोगी

तकनीकी विशेषताTXT (वर्तमान)MDPDFHTML
दृश्य स्वरूपनकोई नहीं (शुद्ध बिना स्टाइल वाला पाठ)हल्का Markdown सिंटैक्सनिश्चित पृष्ठ दृश्य लेआउटपूर्ण CSS और DOM स्टाइलिंग
आवश्यक सॉफ़्टवेयरकोई नहीं (कोई भी टर्मिनल या टेक्स्ट एडिटर)Markdown प्रीव्यूअर / रीडरसमर्पित PDF व्यूअरवेब ब्राउज़र
फ़ाइल का आकारपूर्णतः न्यूनतम संभवन्यूनतम पाठ आकारबड़ा बाइनरी कंटेनरमध्यम मार्कअप ओवरहेड
पुरालेख दीर्घायुअनंत (शुद्ध वर्ण बाइट्स)स्थायी (सादा पाठ)उच्च (ISO मानक)उच्च (W3C मानक)

सामान्य करप्शन मोड और हेक्स रिकवरी गाइड

स्वराघात वाले अक्षर 'é' या काले प्रश्न चिह्न '' जैसे विकृत प्रतीकों के रूप में प्रस्तुत होते हैं।

मूल कारण: एनकोडिंग बेमेल: उचित रूपांतरण के बिना UTF-8 के रूप में खोली गई पुरानी ANSI/Windows-1252 फ़ाइल।

रिकवरी: File2File टेक्स्ट कन्वर्टर का उपयोग करके स्पष्ट UTF-8 एनकोडिंग के साथ फ़ाइल को पुन: एनकोड करें।

सुरक्षा विश्लेषण और पार्सर अटैक वेक्टर्स

सादे पाठ फ़ाइलों में कोई निष्पादित कोड नहीं होता है, लेकिन दुर्भावनापूर्ण यूनिकोड वर्ण उपयोगकर्ताओं को धोखा दे सकते हैं या टर्मिनल इंजेक्शन का कारण बन सकते हैं।

ज्ञात अटैक वेक्टर्स

  • राइट-टू-लेफ्ट ओवरराइड (RTLO) यूनिकोड वर्ण निष्पादित फ़ाइल एक्सटेंशन को स्पूफ करते हैं (उदा. 'report[RTLO]cod.exe')।
  • 'cat' के माध्यम से कच्चे पाठ को देखते समय शेल कमांड निष्पादित करने वाला टर्मिनल एस्केप अनुक्रम इंजेक्शन।
  • URLs में समान दिखने वाले सिरिलिक वर्णों के साथ मानक ASCII अक्षरों को बदलने वाले होमोग्लिफ़ हमले।

सुरक्षात्मक सर्वोत्तम प्रथाएँ:

ऐतिहासिक मूल और मील के पत्थर

2008UTF-8 ने वर्ल्ड वाइड वेब पर प्रमुख टेक्स्ट एनकोडिंग बनने के लिए ASCII और लिगेसी कोड पेजों को पीछे छोड़ दिया।
1991यूनिकोड कंसोर्टियम ने द यूनिकोड स्टैंडर्ड वर्ज़न 1.0 प्रकाशित किया, जो वैश्विक मानव वर्णमाला को एकजुट करता है।
1963अमेरिकन स्टैंडर्ड एसोसिएशन ने ASCII (अमेरिकन स्टैंडर्ड कोड फॉर इंफॉर्मेशन इंटरचेंज) प्रकाशित किया।

मुख्य लाभ और खूबियाँ

  • पूर्ण सार्वभौमिक संगतता: अब तक बनाए गए हर कंप्यूटिंग डिवाइस पर खोला, संपादित और खोजा जा सकता है।
  • स्थायी पुरालेख स्थायित्व: आज बनाई गई एक सादा पाठ फ़ाइल भविष्य में सदियों तक 100% पठनीय रहेगी।
  • शून्य प्रारूप ओवरहेड: बिना किसी मेटाडेटा ब्लोट, बाइनरी टैग या मालिकाना संरचनाओं के शुद्ध डेटा होता है।

तकनीकी सीमाएँ और कमियाँ

  • शून्य दृश्य स्वरूपन: बाहरी मार्कअप भाषा के बिना मूल रूप से बोल्ड, इटैलिक, रंग या फ़ॉन्ट आकार नहीं बदल सकता है।
  • प्लेटफ़ॉर्म लाइन एंडिंग अंतर (Windows CRLF बनाम Unix LF) ऑपरेटिंग सिस्टम में स्वरूपन गड़बड़ियों का कारण बन सकता है।
  • ऐतिहासिक एनकोडिंग अस्पष्टता (ANSI, Shift-JIS, Windows-1252) UTF-8 के बिना चरित्र भ्रष्टाचार (मोजीबाके) का कारण बन सकती है।

रोचक तकनीकी जानकारी

  • UTF-8 का आविष्कार 1992 में न्यू जर्सी के एक डिनर में प्लेसमैट पर केन थॉम्पसन और रॉब पाइक द्वारा रात के खाने के दौरान किया गया था।
  • विंडोज एक नई लाइन के लिए दो वर्णों का उपयोग करता है: कैरिज रिटर्न (CR, 0x0D) और लाइन फीड (LF, 0x0A), जो मैकेनिकल टाइपराइटर की विरासत है।
  • इंटरनेट पर सभी वेबसाइटों का 98% से अधिक हिस्सा UTF-8 टेक्स्ट एनकोडिंग का उपयोग करता है।

अक्सर पूछे جانے वाले तकनीकी प्रश्न

UTF-8 क्या है?

UTF-8 यूनिवर्सल कैरेक्टर एन्कोडिंग मानक है जो ASCII के साथ 100% पीछे की ओर संगत रहते हुए सभी मानव भाषाओं में हर अक्षर, संख्या, प्रतीक और इमोजी का प्रतिनिधित्व कर सकता है।

Windows और Unix लाइन एंडिंग में क्या अंतर है?

Windows नई लाइन को दर्शाने के लिए 'CRLF' (दो बाइट्स: कैरिज रिटर्न + लाइन फीड) का उपयोग करता है, जबकि Unix, Linux और macOS 'LF' (एक सिंगल लाइन फीड बाइट) का उपयोग करते हैं।

मैं TXT फ़ाइल को PDF में कैसे बदल सकता हूँ?

आप अपने वेब ब्राउज़र में सीधे File2File.app का उपयोग करके एक क्लिक में सादे टेक्स्ट फ़ाइलों को साफ़, पेशेवर PDF दस्तावेज़ों या Word दस्तावेज़ों में बदल सकते हैं।