Zwykły tekst (.txt)
ISO/IEC StandardowyPlik zwykłego tekstu (TXT) to uniwersalny fundament cyfrowych obliczeń i przechowywania ludzkich informacji, zawierający surowe, niesformatowane znaki, które mogą być odczytane przez każdy system operacyjny i język programowania, jaki kiedykolwiek powstał.
Konwertuj SRT na TXT
Darmowy konwerter z SRT na TXT w przeglądarce. Konwertuj pliki natychmiast na swoim urządzeniu.
Inspekcja i metadane
Systemy operacyjne i analizatory plików identyfikują pliki TXT, sprawdzając początkową sekwencję bajtów binarnych:
Podpis nagłówka na poziomie bajtów (Magic Bytes)
Systemy operacyjne i analizatory plików identyfikują pliki TXT, sprawdzając początkową sekwencję bajtów binarnych:
PODPIS HEX (OFFSET 0):
EF BB BF / NoneREPREZENTACJA ASCII: UTF-8 BOM / Raw text
Normalizacja: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046
Specyfikacja techniczna
| Architektura kontenera | Sequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859 |
| Kompresja | Uncompressed raw character bytes |
| Kolejność bajtów (Endianness) | UTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32 |
| Przestrzenie kolorów | N/A (Plaintext) |
| Kanały i struktura | Linear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace |
| Maks. wymiary | Unbounded stream length |
| Przezroczystość | None |
| Streaming i progresywne ładowanie | Universal immediate byte-by-byte streaming |
Techniczna macierz porównawcza: TXT a konkurencja
| Atrybut techniczny | TXT (Bieżący) | MD | HTML | |
|---|---|---|---|---|
| Formatowanie wizualne | Brak (czysty, niesformatowany tekst) | Lekka składnia Markdown | Stały układ wizualny strony | Pełne stylowanie CSS i DOM |
| Wymagane oprogramowanie | Brak (dowolny terminal lub edytor tekstu) | Przeglądarka / czytnik plików Markdown | Dedykowana przeglądarka PDF | Przeglądarka internetowa |
| Rozmiar pliku | Absolutnie najmniejszy możliwy | Minimalny rozmiar tekstu | Duży kontener binarny | Umiarkowany narzut znaczników |
| Trwałość archiwalna | Nieskończona (czyste bajty znaków) | Trwała (zwykły tekst) | Wysoka (standard ISO) | Wysoka (standard W3C) |
Typowe tryby uszkodzeń i przewodnik odzyskiwania szesnastkowego
Litery akcentowane wyświetlają się jako zniekształcone symbole, takie jak 'é' lub czarne znaki zapytania ''.
Główna przyczyna: Niedopasowanie kodowania: starszy plik ANSI/Windows-1252 został otwarty jako UTF-8 bez odpowiedniej konwersji.
Odzyskiwanie: Przekoduj plik, wymuszając kodowanie UTF-8 za pomocą konwertera tekstu w File2File.
Analiza bezpieczeństwa i wektory ataku na parser
Pliki zwykłego tekstu nie zawierają kodu wykonywalnego, jednak złośliwe znaki Unicode mogą wprowadzić użytkowników w błąd lub spowodować wstrzyknięcie poleceń do terminala.
Znane wektory ataku
- Znaki Unicode Right-to-Left Override (RTLO) fałszujące rozszerzenia plików wykonywalnych (np. 'raport[RTLO]cod.exe').
- Wstrzykiwanie sekwencji sterujących terminala (terminal escape sequence), które wykonują polecenia powłoki podczas przeglądania surowego tekstu za pomocą polecenia 'cat'.
- Ataki homoglifowe zastępujące standardowe litery ASCII identycznie wyglądającymi znakami cyrylicy w adresach URL.
Najlepsze praktyki obronne:
Pochodzenie historyczne i kamienie milowe
Główne zalety
- Absolutnie uniwersalna kompatybilność: może być otwierany, edytowany i wyszukiwany na każdym urządzeniu obliczeniowym, jakie kiedykolwiek zbudowano.
- Trwałość archiwalna: plik zwykłego tekstu utworzony dzisiaj pozostanie w 100% czytelny przez całe stulecia w przyszłości.
- Zerowy narzut formatu: zawiera czyste dane bez żadnych napuchniętych metadanych, tagów binarnych czy struktur własnościowych.
Ograniczenia techniczne i wady
- Zerowe formatowanie wizualne: nie pozwala natywnie na pogrubianie, kursywę, zmianę kolorów ani rozmiarów czcionek bez zewnętrznego języka znaczników.
- Różnice w znakach końca linii między platformami (Windows CRLF kontra Unix LF) mogą powodować błędy formatowania w różnych systemach operacyjnych.
- Historyczne niejednoznaczności kodowania (ANSI, Shift-JIS, Windows-1252) mogą prowadzić do uszkodzenia znaków (krzaki/mojibake) bez użycia standardu UTF-8.
Ciekawe informacje techniczne
- Standard UTF-8 został wynaleziony na podkładce pod talerz w dinerze w New Jersey w 1992 roku przez Kena Thompsona i Roba Pike'a podczas kolacji.
- System Windows używa dwóch znaków dla nowej linii: Powrót karetki (Carriage Return - CR, 0x0D) oraz Przesuw linii (Line Feed - LF, 0x0A), co stanowi pozostałość po mechanicznych maszynach do pisania.
- Ponad 98% wszystkich stron internetowych w sieci korzysta z kodowania tekstu UTF-8.
Często zadawane pytania techniczne
Czym jest UTF-8?
UTF-8 to uniwersalny standard kodowania znaków, który może reprezentować każdą literę, cyfrę, symbol i emoji we wszystkich językach ludzkich, zachowując jednocześnie 100% wstecznej kompatybilności z ASCII.
Jaka jest różnica między końcami linii w systemie Windows a Unix?
System Windows używa 'CRLF' (dwa bajty: Carriage Return + Line Feed) do reprezentowania nowej linii, podczas gdy systemy Unix, Linux i macOS używają 'LF' (pojedynczy bajt Line Feed).
Jak mogę przekonwertować plik TXT do PDF?
Możesz przekonwertować pliki zwykłego tekstu na przejrzyste, profesjonalne dokumenty PDF lub dokumenty Word jednym kliknięciem za pomocą File2File.app bezpośrednio w przeglądarce internetowej.
Powiązane pary konwersji TXT
Konwersja plików z napisami SRT do formatu TXT usuwa kody czasowe oraz numery indeksów, pozostawiając czysty, czytelny dialog.
Konwersja skanowanego obrazu na wyodrębniony tekst zamienia piksele obrazu w edytowalne znaki, dzięki czemu możesz łatwo wyszukiwać, edytować i przechowywać słowa.
Konwersja rastrowego dokumentu graficznego PNG na czysty tekst przekształca statyczne piksele obrazu w edytowalne słowa przy użyciu optycznego rozpoznawania znaków.