Obyčajný text (.txt)
ISO/IEC ŠtandardSúbor obyčajného textu (TXT) je univerzálnym základom digitálnych výpočtov a ukladania ľudských informácií, ktorý obsahuje surové, neformátované znaky čitateľné v každom existujúcom operačnom systéme a programovacom jazyku.
Konvertovať SRT do TXT
Bezplatný konvertor z SRT do TXT priamo v prehliadači. Konvertujte súbory okamžite vo svojom zariadení.
Preskúmať a metadáta
Operačné systémy a analyzátory súborov identifikujú súbory TXT kontrolou počiatočnej binárnej bajtovej sekvencie:
Podpis hlavičky na úrovni bajtov (Magic Bytes)
Operačné systémy a analyzátory súborov identifikujú súbory TXT kontrolou počiatočnej binárnej bajtovej sekvencie:
HEXADECIMÁLNY PODPIS (OFFSET 0):
EF BB BF / NoneASCII REPREZENTÁCIA: UTF-8 BOM / Raw text
Štandardizácia: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046
Technické špecifikácie
| Architektúra kontajnera | Sequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859 |
| Kompresia | Uncompressed raw character bytes |
| Poradie bajtov (Endianness) | UTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32 |
| Farebné priestory | N/A (Plaintext) |
| Kanály a štruktúra | Linear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace |
| Max. rozmery | Unbounded stream length |
| Priehľadnosť | None |
| Streamovanie a postupné načítavanie | Universal immediate byte-by-byte streaming |
Technická porovnávacia matica: TXT vs konkurenti
| Technický atribút | TXT (Aktuálne) | MD | HTML | |
|---|---|---|---|---|
| Vizuálne formátovanie | Žiadne (čistý nestylovaný text) | Ľahká syntax Markdown | Fixné vizuálne rozloženie stránky | Plný štýl CSS & DOM |
| Požadovaný softvér | Žiadny (akýkoľvek terminál alebo textový editor) | Prehliadač / čítačka Markdown | Špecializovaný prehliadač PDF | Webový prehliadač |
| Veľkosť súboru | Absolútne možné minimum | Minimálna veľkosť textu | Veľký binárny kontajner | Umerná réžia značkovania |
| Dlhodobá životnosť v archíve | Nekonečná (čisté bajty znakov) | Trvalá (obyčajný text) | Vysoká (štandard ISO) | Vysoká (štandard W3C) |
Bežné režimy poškodenia a príručka na obnovu v hexadecimálnom kóde
Sviatočné písmená sa vykresľujú ako skreslené symboly ako 'é' alebo čierne otázniky ''.
Hlavná príčina: Nesúlad kódovania: starší súbor ANSI/Windows-1252 otvorený ako UTF-8 bez správneho prevodu.
Obnova: Znovu zakódujte súbor s explicitným kódovaním UTF-8 pomocou textového konvertora File2File.
Bezpečnostná analýza a vektory útokov na parser
Súbory v obyčajnom texte neobsahujú žiadny spustiteľný kód, ale škodlivé znaky unicode môžu oklamať používateľov alebo spôsobiť injektáž terminálu.
Známe vektory útokov
- Znaky unicode Right-to-Left Override (RTLO) maskujúce prípony spustiteľných súborov (napr. 'report[RTLO]cod.exe').
- Injekcia únikových sekvencií terminálu spúšťajúca príkazy shellu pri zobrazení surového textu cez 'cat'.
- Homoglifové útoky nahrádzajúce štandardné písmená ASCII nerozoznateľne podobnými cyrilskými znakmi v adresách URL.
Najlepšie obranné postupy:
Historický pôvod a míľniky
Kľúčové výhody a prednosti
- Absolútna univerzálna kompatibilita: dá sa otvoriť, upravovať a prehledávať na každom vytvorenom výpočtovom zariadení.
- Trvalá archivovateľnosť: súbor v obyčajnom texte vytvorený dnes zostane stopercentne čitateľný aj o storočia neskôr.
- Nulová réžia formátu: obsahuje čisté dáta bez akéhokoľvek nadúvania metadátami, binárnych značiek alebo proprietárnych štruktúr.
Technické obmedzenia a nevýhody
- Nulové vizuálne formátovanie: bez externého značkovacieho jazyka nedokáže natívne písať tučným písmom, kurzívou, meniť farbu ani veľkosť fontu.
- Rozdiely v ukončeniach riadkov medzi platformami (Windows CRLF vs Unix LF) môžu spôsobovať problémy s formátovaním naprieč operačnými systémami.
- Historické nejasnosti v kódovaní (ANSI, Shift-JIS, Windows-1252) môžu bez UTF-8 spôsobiť korupciu znakov (mojibake).
Zaujímavé technické drobnosti
- Kódovanie UTF-8 vynájdené Kenom Thompsonom a Robom Pikom počas večere v roku 1992 na obrúsku v reštaurácii v New Jersey.
- Windows používa na nový riadok dva znaky: Carriage Return (CR, 0x0D) a Line Feed (LF, 0x0A), čo je pozostatok z mechanických písacích strojov.
- Viac ako 98 % všetkých webových stránok na internete používa textové kódovanie UTF-8.
Často kladené technické otázky
Čo je to UTF-8?
UTF-8 je univerzálny štandard kódovania znakov, ktorý dokáže reprezentovať každé písmeno, číslo, symbol a emoji vo všetkých ľudských jazykoch a zároveň zostáva 100 % spätne kompatibilný s ASCII.
Aký je rozdiel medzi koncami riadkov v systéme Windows a Unix?
Windows používa na označenie nového riadku znak 'CRLF' (dva bajty: Carriage Return + Line Feed), zatiaľ čo Unix, Linux a macOS používajú 'LF' (jeden bajt Line Feed).
Ako môžem konvertovať súbor TXT do formátu PDF?
Pomocou File2File.app priamo vo vašom webovom prehliadači môžete súbory s čistým textom jedným kliknutím konvertovať na čisté, profesionálne dokumenty PDF alebo dokumenty Word.
Súvisiace konverzné páry pre TXT
Konverzia súborov so subtitulkami SRT na textové prepisy odstráni kódy načasovania a indexové čísla, pričom zanechá čisté a čitateľné dialógy.
Konverzia naskenovaného obrázka na extrahovaný text prevádza obrazové pixely na upraviteľné znaky, takže môžete ľahko vyhľadávať, upravovať a ukladat slová.
Konverzia rastrového obrázkového dokumentu PNG na čistý text premieňa statické obrazové pixely na upraviteľné slová pomocou optického rozpoznávania znakov.