Text simplu (.txt)
ISO/IEC StandardFișierul text simplu (TXT) este fundamentul universal al computației digitale și al stocării informațiilor umane, conținând caractere brute, neformatate, care pot fi citite de fiecare sistem de operare de calculator și limbaj de programare existent.
Convertește din SRT în TXT
Convertor gratuit din SRT în TXT direct în browser. Convertește fișiere instantaneu pe dispozitivul tău.
Inspectează și Metadate
Sistemele de operare și analizatoarele de fișiere identifică fișierele TXT prin inspectarea secvenței binare inițiale:
Semnătura antetului la nivel de octet (Magic Bytes)
Sistemele de operare și analizatoarele de fișiere identifică fișierele TXT prin inspectarea secvenței binare inițiale:
SEMNĂTURĂ HEX (OFFSET 0):
EF BB BF / NoneREPREZENTARE ASCII: UTF-8 BOM / Raw text
Standardizare: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046
Specificații tehnice
| Arhitectură container | Sequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859 |
| Compresie | Uncompressed raw character bytes |
| Endianitatea octeților | UTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32 |
| Spații de culoare | N/A (Plaintext) |
| Canale și structură | Linear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace |
| Dimensiuni maxime | Unbounded stream length |
| Transparență | None |
| Streaming și progresiv | Universal immediate byte-by-byte streaming |
Matrice de comparație tehnică: TXT vs Competitori
| Atribut tehnic | TXT (Curent) | MD | HTML | |
|---|---|---|---|---|
| Formatare vizuală | Niciuna (text pur fără stil) | Sintaxă Markdown ușoară | Aspect vizual fix al paginii | Stil complet CSS și DOM |
| Software necesar | Niciunul (orice terminal sau editor de text) | Vizualizator / cititor Markdown | Vizualizator PDF dedicat | Browser web |
| Dimensiunea fișierului | Absolut minimă posibilă | Dimensiune minimă a textului | Container binar mare | Supradimensionare moderată de marcare |
| Longevitate arhivistică | Infinită (octeți de caractere puri) | Permanentă (text simplu) | Ridicată (standard ISO) | Ridicată (standard W3C) |
Moduri comune de corupție și ghid de recuperare hexazecimală
Literele cu diacritice sau accentuate apar ca simboluri eronate, cum ar fi 'é' sau semne de întrebare negre ''.
Cauză principală: Neconcordanță de codificare: un fișier ANSI/Windows-1252 mai vechi a fost deschis ca UTF-8 fără conversie corespunzătoare.
Recuperare: Re-codificați fișierul cu codificare UTF-8 explicită utilizând Convertorul de Text File2File.
Analiză de securitate și vectori de atac asupra parserului
Fișierele text simplu nu conțin cod executabil, dar caracterele unicode malițioase pot înșela utilizatorii sau pot provoca injecții în terminal.
Vectori de atac cunoscuți
- Caractere unicode Right-to-Left Override (RTLO) care maschează extensii de fișiere executabile (de ex., 'report[RTLO]cod.exe').
- Injecție de secvențe de evadare în terminal care execută comenzi de shell la vizualizarea textului brut prin 'cat'.
- Atacuri de omoglife care înlocuiesc literele ASCII standard cu caractere chirilice cu aspect identic în adresele URL.
Cele mai bune practici de securitate:
Origini istorice și repere
Avantaje cheie și beneficii
- Compatibilitate universală absolută: poate fi deschis, editat și căutat pe orice dispozitiv de calcul construit vreodată.
- Permanență arhivistică permanentă: un fișier text simplu creat astăzi va rămâne 100% citibil timp de secole în viitor.
- Zero supradimensionare de format: conține date pure fără nicio încărcătură suplimentară de metadate, etichete binare sau structuri proprietare.
Limitări tehnice și dezavantaje
- Zero formatare vizuală: nu poate aplica în mod nativ caractere aldine, cursive, culoare sau modifica dimensiunile fonturilor fără un limbaj de marcare extern.
- Diferențele de sfârșit de rând între platforme (Windows CRLF vs Unix LF) pot provoca probleme de formatare în diferite sisteme de operare.
- Ambiguitățile istorice de codificare (ANSI, Shift-JIS, Windows-1252) pot cauza coruperea caracterelor (mojibake) în absența UTF-8.
Curiozități tehnice interesante
- UTF-8 a fost inventat pe un șervețel dintr-un diner din New Jersey în 1992 de Ken Thompson și Rob Pike în timpul cinei.
- Windows folosește două caractere pentru o linie nouă: Carriage Return (CR, 0x0D) și Line Feed (LF, 0x0A), o moștenire de la mașinile de scris mecanice.
- Peste 98% din toate site-urile web de pe internet utilizează codificarea text UTF-8.
Întrebări tehnice frecvente
Ce este UTF-8?
UTF-8 este standardul universal de codare a caracterelor care poate reprezenta fiecare literă, număr, simbol și emoji din toate limbile umane, menținând în același timp o compatibilitate retroactivă de 100% cu ASCII.
Care este diferența dintre sfârșurile de linie Windows și Unix?
Windows folosește 'CRLF' (doi octeți: Carriage Return + Line Feed) pentru a reprezenta o linie nouă, în timp ce Unix, Linux și macOS folosesc 'LF' (un singur octet Line Feed).
Cum pot converti un fișier TXT în PDF?
Puteți converti fișiere text simplu în documente PDF curate și profesionale sau în documente Word cu un singur clic folosind File2File.app direct în browserul dumneavoastră web.
Perechi de conversie TXT conexe
Conversia fișierelor subtitrat SRT în transcrieri TXT elimină codurile de timp și numerele de index, lăsând doar dialogul curat și ușor de citit.
Conversia unei imagini scanate în text extras transpune pixelii imaginii în caractere editabile, astfel încât să puteți căuta, edita și stoca cu ușurință cuvintele.
Conversia unei imagini rastru de document în text simplu extrage caractere citibile de mașină folosind recunoașterea optică a caracterelor, transformând grafica statică în text editabil.