Prostý text (.txt)
ISO/IEC StandardníSoubor prostého textu (TXT) je univerzálním základem digitálních výpočtů a ukládání lidských informací. Obsahuje nezpracované, neformátované znaky, které dokáže přečíst každý existující počítačový operační systém a programovací jazyk.
Převést SRT do TXT
Bezplatný konvertor z SRT do TXT v prohlížeči. Převeďte soubory okamžitě ve svém zařízení.
Zkontrolovat a metadata
Operační systémy a analyzátory souborů identifikují soubory TXT kontrolou počáteční binární sekvence bajtů:
Podpis hlavičky na úrovni bajtů (Magic Bytes)
Operační systémy a analyzátory souborů identifikují soubory TXT kontrolou počáteční binární sekvence bajtů:
HEXADECIMÁLNÍ PODPIS (OFFSET 0):
EF BB BF / NoneASCII REPREZENTACE: UTF-8 BOM / Raw text
Standardizace: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046
Technické specifikace
| Architektura kontejneru | Sequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859 |
| Komprese | Uncompressed raw character bytes |
| Endiantita bajtů | UTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32 |
| Barevné prostory | N/A (Plaintext) |
| Kanály a struktura | Linear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace |
| Max. rozměry | Unbounded stream length |
| Průhlednost | None |
| Streamování a progresivní načítání | Universal immediate byte-by-byte streaming |
Technická srovnávací matice: TXT vs konkurence
| Technický atribut | TXT (Aktuální) | MD | HTML | |
|---|---|---|---|---|
| Vizuální formátování | Žádné (čistý nestylovaný text) | Lehká syntaxe Markdown | Pevné vizuální rozvržení stránky | Úplné stylování pomocí CSS a DOM |
| Požadovaný software | Žádný (jakýkoliv terminál nebo textový editor) | Prohlížeč / čtečka Markdownu | Specializovaný prohlížeč PDF | Webový prohlížeč |
| Velikost souboru | Absolutně nejmenší možná | Minimální velikost textu | Velký binární kontejner | Mírná režie značkování |
| Archivní životnost | Nekonečná (čisté bajty znaků) | Trvalá (prostý text) | Vysoká (norma ISO) | Vysoká (norma W3C) |
Běžné režimy poškození a příručka pro obnovení v hex
Slovesa s diakritikou se vykreslují jako poškozené symboly typu 'é' nebo černé otazníky ''.
Hlavní příčina: Nesoulad kódování: starší soubor ANSI/Windows-1252 byl otevřen jako UTF-8 bez správného převodu.
Obnovení: Převeďte soubor do explicitního kódování UTF-8 pomocí nástroje File2File Text Converter.
Bezpečnostní analýza a vektory útoků na parser
Soubory prostého textu neobsahují žádný spustitelný kód, ale škodlivé znaky Unicode mohou uživatele oklamat nebo způsobit injektáž do terminálu.
Známé vektory útoků
- Znaky Unicode typu Right-to-Left Override (RTLO) maskující přípony spustitelných souborů (např. 'report[RTLO]cod.exe').
- Injektáž sekvencí pro únik z terminálu (escape sekvencí), které spouštějí příkazy shellu při zobrazení surového textu přes 'cat'.
- Útoky typu homoglyf nahrazující standardní znaky ASCII vizuálně identickými cyrilicovými znaky v adresách URL.
Doporučené bezpečnostní postupy:
Historický vývoj a milníky
Klíčové výhody a přednosti
- Absolutní univerzální kompatibilita: lze jej otevřít, upravit a prohledat na jakémkoliv vytvořeném výpočetním zařízení.
- Trvalá archivní stálost: soubor prostého textu vytvořený dnes zůstane 100% čitelný i za několik století.
- Nulová režie formátu: obsahuje čistá data bez nadbytečných metadat, binárních značek nebo vlastních proprietárních struktur.
Technická omezení a nevýhody
- Nulové vizuální formátování: bez externího značkovacího jazyka neumí nativně tučně zvýrazňovat, kurzívu, měnit barvy ani velikosti fontů.
- Rozdíly v ukončování řádků mezi platformami (Windows CRLF vs. Unix LF) mohou způsobit problémy s formátováním napříč operačními systémy.
- Historické nejasnosti v kódování (ANSI, Shift-JIS, Windows-1252) mohou bez použití UTF-8 způsobit poškození znaků (tzv. mojibake).
Zajímavé technické drobnosti
- Kódování UTF-8 vymysleli Ken Thompson a Rob Pike v roce 1992 u večeře nad ubrouskem v restauraci v New Jersey.
- Windows používají pro nový řádek dva znaky: Carriage Return (CR, 0x0D) a Line Feed (LF, 0x0A), což je dědictví z mechanických psacích strojů.
- Více než 98 % všech webových stránek na internetu používá kódování textu UTF-8.
Často kladené technické otázky
Co je to UTF-8?
UTF-8 je univerzální standard kódování znaků, který dokáže reprezentovat každé písmeno, číslo, symbol a emotikon ve všech lidských jazycích a zároveň zůstává 100% zpětně kompatibilní s ASCII.
Jaký je rozdíl mezi konenci řádků ve Windows a Unixu?
Windows používá k vyjádření nového řádku 'CRLF' (dva bajty: Carriage Return + Line Feed), zatímco Unix, Linux a macOS používají 'LF' (jeden bajt Line Feed).
Jak mohu převést soubor TXT do formátu PDF?
Soubory prostého textu můžete jedním kliknutím převést na čisté, profesionální dokumenty PDF nebo dokumenty Word pomocí File2File.app přímo ve vašem webovém prohlížeči.
Související konverzní páry pro TXT
Převedení souborů s titulky SRT na přepisy v TXT odstraní kódy časování a čísla indexů a zanechá čistý a čitelný dialog.
Konverze naskenovaného obrázku na extrahovaný text převádí obrazové pixely na upravitelné znaky, abyste mohli snadno vyhledávat, upravovat a ukládat slova.
Převedení rastrového obrázku dokumentu PNG na prostý text mění statické obrazové body na upravitelná slova pomocí optického rozpoznávání znaků.