ข้อความธรรมดา (.txt)

ISO/IEC มาตรฐาน

ไฟล์ข้อความธรรมดา (TXT) คือรากฐานสากลของการประมวลผลดิจิทัลและการจัดเก็บข้อมูลของมนุษย์ ซึ่งประกอบด้วยอักขระดิบที่ไม่มีการจัดรูปแบบซึ่งสามารถอ่านได้โดยทุกระบบปฏิบัติการคอมพิวเตอร์และภาษาโปรแกรมที่มีอยู่

แปลง SRT เป็น TXT

ตัวแปลงจาก SRT เป็น TXT ฟรีในเบราว์เซอร์ แปลงไฟล์ได้ทันทีบนอุปกรณ์ของคุณ

ตรวจสอบและดู Metadata

ระบบปฏิบัติการและเครื่องมือวิเคราะห์ไฟล์จะระบุไฟล์ TXT โดยการตรวจสอบลำดับไบต์ไบนารีส่วนต้น:

เลือกหรือวางไฟล์ที่นี่

การแปลงไฟล์แบบส่วนตัว 100% ในเบราว์เซอร์ - ไฟล์จะไม่ rời ออกจากอุปกรณ์ของคุณ

หรือวาง Ctrl+V
การรับประกันความเป็นส่วนตัวแบบไม่มีการส่งผ่านเครือข่าย: อัปโหลด 0 ไบต์ไปยังเซิร์ฟเวอร์ภายนอก การประมวลผลทั้งหมดเกิดขึ้นภายในแซนด์บ็อกซ์ของเบราว์เซอร์ของคุณ

ลายเซ็นส่วนหัวในระดับไบต์ (Magic Bytes)

ระบบปฏิบัติการและเครื่องมือวิเคราะห์ไฟล์จะระบุไฟล์ TXT โดยการตรวจสอบลำดับไบต์ไบนารีส่วนต้น:

ลายเซ็น HEX (OFFSET 0):

EF BB BF / None

การแสดงผลรูปแบบ ASCII: UTF-8 BOM / Raw text

มาตรฐาน: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046

ข้อมูลจำเพาะทางเทคนิค

สถาปัตยกรรมคอนเทนเนอร์Sequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859
การบีบอัดUncompressed raw character bytes
การจัดลำดับไบต์ (Byte Endianness)UTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32
พื้นที่สีN/A (Plaintext)
ช่องสัญญาณและโครงสร้างLinear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace
ขนาดสูงสุดUnbounded stream length
ความโปร่งใสNone
การสตรีมและแบบโปรเกรสซีฟUniversal immediate byte-by-byte streaming

ตารางเปรียบเทียบทางเทคนิค: TXT กับคู่แข่ง

คุณลักษณะทางเทคนิคTXT (ปัจจุบัน)MDPDFHTML
การจัดรูปแบบภาพไม่มี (ข้อความดิบไม่มีการตกแต่ง)ไวยากรณ์ Markdown น้ำหนักเบาเค้าโครงภาพหน้ากระดาษตายตัวการจัดสไตล์ CSS และ DOM เต็มรูปแบบ
ซอฟต์แวร์ที่ต้องใช้ไม่มี (เทอร์มินัลหรือโปรแกรมแก้ไขข้อความใดก็ได้)โปรแกรมดู / ตัวอ่าน Markdownโปรแกรมอ่าน PDF โดยเฉพาะเว็บเบราว์เซอร์
ขนาดไฟล์เล็กที่สุดเท่าที่จะเป็นไปได้ขนาดข้อความminimalคอนเทนเนอร์ไบนารีขนาดใหญ่ค่าใช้จ่ายมาร์กอัปปานกลาง
อายุการเก็บถาวรอนันต์ (ไบต์อักขระบริสุทธิ์)ถาวร (ข้อความธรรมดา)สูง (มาตรฐาน ISO)สูง (มาตรฐาน W3C)

รูปแบบความเสียหายทั่วไปและคู่มือการกู้คืน Hex

ตัวอักษรที่มีเครื่องหมายกำกับแสดงผลเป็นสัญลักษณ์เพี้ยนๆ เช่น 'é' หรือเครื่องหมายคำถามสีดำ ''

สาเหตุหลัก: การเข้ารหัสที่ไม่ตรงกัน: ไฟล์ ANSI/Windows-1252 รุ่นเก่าถูกเปิดเป็น UTF-8 โดยไม่มีการแปลงที่ถูกต้อง

การกู้คืน: เข้ารหัสไฟล์ใหม่ด้วยการเข้ารหัส UTF-8 ที่ชัดเจนโดยใช้ File2File Text Converter

การวิเคราะห์ความปลอดภัยและเวกเตอร์การโจมตีตัวแยกวิเคราะห์

ไฟล์ข้อความธรรมดาไม่มีโค้ดที่สามารถรันได้ แต่อักขระยูนิโคดที่เป็นอันตรายอาจหลอกลวงผู้ใช้หรือทำให้เกิดการฉีดคำสั่งผ่านเทอร์มินัล

เวกเตอร์การโจมตีที่ทราบ

  • อักขระยูนิโคด Right-to-Left Override (RTLO) ที่ปลอมแปลงนามสกุลไฟล์ที่สามารถรันได้ (เช่น 'report[RTLO]cod.exe')
  • การฉีดสคริปต์ควบคุมเทอร์มินัล (Terminal escape sequence) ที่รันคำสั่งเชลล์เมื่อดูข้อความดิบผ่านคำสั่ง 'cat'
  • การโจมตีแบบ Homoglyph ที่แทนที่ตัวอักษรมาตรฐาน ASCII ด้วยตัวอักษรซีริลลิกที่มีหน้าตาเหมือนกันใน URL

แนวทางปฏิบัติที่ดีที่สุดในการป้องกัน:

ประวัติความเป็นมาและเหตุการณ์สำคัญ

2008UTF-8 แซงหน้า ASCII และหน้าโค้ดเดิมเพื่อกลายเป็นชุดรหัสตัวอักษรหลักบนเวิลด์ไวด์เว็บ
1991กลุ่มบริษัท Unicode Consortiumเผยแพร่มาตรฐาน The Unicode Standard Version 1.0 ซึ่งรวมตัวอักษรของมนุษย์ทั่วโลกเข้าด้วยกัน
1963สมาคมมาตรฐานอเมริกันเผยแพร่ ASCII (American Standard Code for Information Interchange)

ข้อได้เปรียบและจุดเด่นสำคัญ

  • ความเข้ากันได้สากลอย่างแท้จริง: สามารถเปิด แก้ไข และค้นหาได้บนทุกอุปกรณ์คอมพิวเตอร์ที่เคยสร้างมา
  • ความคงทนในการเก็บถาวร: ไฟล์ข้อความธรรมดาที่สร้างขึ้นในวันนี้จะยังคงอ่านได้ 100% ในอีกหลายศตวรรษข้างหน้า
  • ไม่มีค่าใช้จ่ายแฝงของรูปแบบ: บรรจุข้อมูลบริสุทธิ์โดยไม่มีส่วนเกินของเมตาดาต้า แท็กไบนารี หรือโครงสร้างที่เป็นกรรมสิทธิ์

ข้อจำกัดทางเทคนิคและข้อควรพิจารณา

  • ไม่มีการจัดรูปแบบภาพ: ไม่สามารถทำตัวหนา ตัวเอียง เปลี่ยนสี หรือเปลี่ยนขนาดตัวอักษรได้โดยธรรมชาติโดยปราศจากภาษามาร์กอัปภายนอก
  • ความแตกต่างของการขึ้นบรรทัดใหม่ตามแพลตฟอร์ม (Windows CRLF กับ Unix LF) อาจทำให้เกิดข้อผิดพลาดในการแสดงผลข้ามระบบปฏิบัติการ
  • ความคลุมเครือของการเข้ารหัสในอดีต (ANSI, Shift-JIS, Windows-1252) อาจทำให้ข้อมูลอักขระเสียหาย (Mojibake) หากไม่มีการใช้ UTF-8

เกร็ดความรู้ทางเทคนิคที่น่าสนใจ

  • UTF-8 ถูกคิดค้นขึ้นบนแผ่นรองจานในร้านอาหารแห่งหนึ่งในรัฐนิวเจอร์ซีย์ในปี 1992 โดย Ken Thompson และ Rob Pike ระหว่างมื้อค่ำ
  • Windows ใช้สองอักขระสำหรับบรรทัดใหม่: Carriage Return (CR, 0x0D) และ Line Feed (LF, 0x0A) ซึ่งเป็นมรดกจากเครื่องพิมพ์ดีดกล
  • เว็บไซต์กว่า 98% บนอินเทอร์เน็ตใช้การเข้ารหัสข้อความแบบ UTF-8

คำถามทางเทคนิคที่พบบ่อย

UTF-8 คืออะไร

UTF-8 คือมาตรฐานการเข้ารหัสอักขระสากลที่สามารถแทนที่ตัวอักษร ตัวเลข สัญลักษณ์ และอีโมจิทุกตัวในทุกภาษาของมนุษย์ ในขณะที่ยังคงความเข้ากันได้แบบย้อนหลังกับ ASCII 100%

ความแตกต่างระหว่างจุดสิ้นสุดบรรทัดแบบ Windows และ Unix คืออะไร

Windows ใช้ 'CRLF' (สองไบต์: Carriage Return + Line Feed) เพื่อแทนการขึ้นบรรทัดใหม่ ในขณะที่ Unix, Linux และ macOS ใช้ 'LF' (ไบต์ Line Feed เดี่ยว)

ฉันจะแปลงไฟล์ TXT เป็น PDF ได้อย่างไร

คุณสามารถแปลงไฟล์ข้อความธรรมดาเป็นเอกสาร PDF หรือเอกสาร Word ที่สะอาดและเป็นมืออาชีพได้ด้วยคลิกเดียวโดยใช้ File2File.app บนเว็บเบราว์เซอร์ของคุณ