Prostý text (.txt)

ISO/IEC Standardní

Soubor prostého textu (TXT) je univerzálním základem digitálních výpočtů a ukládání lidských informací. Obsahuje nezpracované, neformátované znaky, které dokáže přečíst každý existující počítačový operační systém a programovací jazyk.

Převést SRT do TXT

Bezplatný konvertor z SRT do TXT v prohlížeči. Převeďte soubory okamžitě ve svém zařízení.

Zkontrolovat a metadata

Operační systémy a analyzátory souborů identifikují soubory TXT kontrolou počáteční binární sekvence bajtů:

Vyberte nebo přetáhněte soubory sem

100% soukromá konverze v prohlížeči - soubory nikdy neopustí vaše zařízení

nebo vložte Ctrl+V
Záruka ochrany soukromí s nulovým přenosem po síti: 0 bajtů odesláno na externí servery. Veškeré zpracování probíhalo lokálně v sandboxu vašeho prohlížeče.

Podpis hlavičky na úrovni bajtů (Magic Bytes)

Operační systémy a analyzátory souborů identifikují soubory TXT kontrolou počáteční binární sekvence bajtů:

HEXADECIMÁLNÍ PODPIS (OFFSET 0):

EF BB BF / None

ASCII REPREZENTACE: UTF-8 BOM / Raw text

Standardizace: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046

Technické specifikace

Architektura kontejneruSequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859
KompreseUncompressed raw character bytes
Endiantita bajtůUTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32
Barevné prostoryN/A (Plaintext)
Kanály a strukturaLinear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace
Max. rozměryUnbounded stream length
PrůhlednostNone
Streamování a progresivní načítáníUniversal immediate byte-by-byte streaming

Technická srovnávací matice: TXT vs konkurence

Technický atributTXT (Aktuální)MDPDFHTML
Vizuální formátováníŽádné (čistý nestylovaný text)Lehká syntaxe MarkdownPevné vizuální rozvržení stránkyÚplné stylování pomocí CSS a DOM
Požadovaný softwareŽádný (jakýkoliv terminál nebo textový editor)Prohlížeč / čtečka MarkdownuSpecializovaný prohlížeč PDFWebový prohlížeč
Velikost souboruAbsolutně nejmenší možnáMinimální velikost textuVelký binární kontejnerMírná režie značkování
Archivní životnostNekonečná (čisté bajty znaků)Trvalá (prostý text)Vysoká (norma ISO)Vysoká (norma W3C)

Běžné režimy poškození a příručka pro obnovení v hex

Slovesa s diakritikou se vykreslují jako poškozené symboly typu 'é' nebo černé otazníky ''.

Hlavní příčina: Nesoulad kódování: starší soubor ANSI/Windows-1252 byl otevřen jako UTF-8 bez správného převodu.

Obnovení: Převeďte soubor do explicitního kódování UTF-8 pomocí nástroje File2File Text Converter.

Bezpečnostní analýza a vektory útoků na parser

Soubory prostého textu neobsahují žádný spustitelný kód, ale škodlivé znaky Unicode mohou uživatele oklamat nebo způsobit injektáž do terminálu.

Známé vektory útoků

  • Znaky Unicode typu Right-to-Left Override (RTLO) maskující přípony spustitelných souborů (např. 'report[RTLO]cod.exe').
  • Injektáž sekvencí pro únik z terminálu (escape sekvencí), které spouštějí příkazy shellu při zobrazení surového textu přes 'cat'.
  • Útoky typu homoglyf nahrazující standardní znaky ASCII vizuálně identickými cyrilicovými znaky v adresách URL.

Doporučené bezpečnostní postupy:

Historický vývoj a milníky

2008UTF-8 překonává ASCII a starší kódové stránky a stává se dominantním kódováním textu na World Wide Webu.
1991Konsorcium Unicode vydává standard Unicode verze 1.0, který sjednocuje lidské abecedy světa.
1963Americká asociace pro normy (ASA) publikuje kód ASCII (American Standard Code for Information Interchange).

Klíčové výhody a přednosti

  • Absolutní univerzální kompatibilita: lze jej otevřít, upravit a prohledat na jakémkoliv vytvořeném výpočetním zařízení.
  • Trvalá archivní stálost: soubor prostého textu vytvořený dnes zůstane 100% čitelný i za několik století.
  • Nulová režie formátu: obsahuje čistá data bez nadbytečných metadat, binárních značek nebo vlastních proprietárních struktur.

Technická omezení a nevýhody

  • Nulové vizuální formátování: bez externího značkovacího jazyka neumí nativně tučně zvýrazňovat, kurzívu, měnit barvy ani velikosti fontů.
  • Rozdíly v ukončování řádků mezi platformami (Windows CRLF vs. Unix LF) mohou způsobit problémy s formátováním napříč operačními systémy.
  • Historické nejasnosti v kódování (ANSI, Shift-JIS, Windows-1252) mohou bez použití UTF-8 způsobit poškození znaků (tzv. mojibake).

Zajímavé technické drobnosti

  • Kódování UTF-8 vymysleli Ken Thompson a Rob Pike v roce 1992 u večeře nad ubrouskem v restauraci v New Jersey.
  • Windows používají pro nový řádek dva znaky: Carriage Return (CR, 0x0D) a Line Feed (LF, 0x0A), což je dědictví z mechanických psacích strojů.
  • Více než 98 % všech webových stránek na internetu používá kódování textu UTF-8.

Často kladené technické otázky

Co je to UTF-8?

UTF-8 je univerzální standard kódování znaků, který dokáže reprezentovat každé písmeno, číslo, symbol a emotikon ve všech lidských jazycích a zároveň zůstává 100% zpětně kompatibilní s ASCII.

Jaký je rozdíl mezi konenci řádků ve Windows a Unixu?

Windows používá k vyjádření nového řádku 'CRLF' (dva bajty: Carriage Return + Line Feed), zatímco Unix, Linux a macOS používají 'LF' (jeden bajt Line Feed).

Jak mohu převést soubor TXT do formátu PDF?

Soubory prostého textu můžete jedním kliknutím převést na čisté, profesionální dokumenty PDF nebo dokumenty Word pomocí File2File.app přímo ve vašem webovém prohlížeči.