Egyszerű szöveg (.txt)
ISO/IEC SzabványA sima szöveges fájl (TXT) a digitális számítástechnika és az emberi információtárolás univerzális alapköve, amely nyers, formázatlan karaktereket tartalmaz, amelyeket a létező összes számítógépes operációs rendszer és programozási nyelv képes olvasni.
SRT konvertálása erre: TXT
Ingyenes, böngészőn belüli SRT - TXT konvertáló. Konvertáljon fájlokat azonnal az eszközén.
Vizsgálat és metaadatok
Az operációs rendszerek és a fájlelemzők a kezdő bináris bájtsorozat vizsgálatával azonosítják a(z) TXT fájlokat:
Bájt-szintű fejléc aláírás (Magic Bytes)
Az operációs rendszerek és a fájlelemzők a kezdő bináris bájtsorozat vizsgálatával azonosítják a(z) TXT fájlokat:
HEX ALÁÍRÁS (ELTOLÁS 0):
EF BB BF / NoneASCII REPREZENTÁCIÓ: UTF-8 BOM / Raw text
Szabványosítás: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046
Műszaki specifikációk
| Konténer architektúra | Sequential sequence of human-readable characters encoded as ASCII, UTF-8, UTF-16, or ISO-8859 |
| Tömörítés | Uncompressed raw character bytes |
| Bájtsorrend | UTF-8 (byte order neutral); Big/Little-Endian indicated by BOM in UTF-16/32 |
| Színterek | N/A (Plaintext) |
| Csatornák és struktúra | Linear stream of characters, newline markers (LF \n or CRLF \r\n), and whitespace |
| Max. méretek | Unbounded stream length |
| Átlátszóság | None |
| Streaming és progresszív | Universal immediate byte-by-byte streaming |
Műszaki összehasonlító mátrix: TXT vs Versenytársak
| Technikai attribútum | TXT (Jelenlegi) | MD | HTML | |
|---|---|---|---|---|
| Vizuális formázás | Nincs (tiszta, stílus nélküli szöveg) | Könnyű Markdown szintaxissal | Rögzített oldalas vizuális elrendezés | Teljes CSS és DOM stílus |
| Szükséges szoftver | Nincs (bármilyen terminál vagy szövegszerkesztő) | Markdown előnézeti nézegető / olvasó | Dedikált PDF-megjelenítő | Webböngésző |
| Fájlméret | Abszolút lehetséges minimum | Minimális szövegméret | Nagy bináris tároló | Mérsékelt leíró rezsi |
| Archiválási élettartam | Végtelen (tiszta karakterbájtok) | Állandó (sima szöveg) | Magas (ISO szabvány) | Magas (W3C szabvány) |
Gyakori sérülési módok és hexadecimális helyreállítási útmutató
A ékezetes betűk torz szimbólumokként jelennek meg, mint az 'é' vagy fekete kérdőjelek ''.
Kiváltó ok: Kódolási eltérés: egy régebbi ANSI/Windows-1252 fájl megnyitása UTF-8-ként megfelelő átalakítás nélkül.
Helyreállítás: Kódolja újra a fájlt explicit UTF-8 kódolással a File2File Text Converter segítségével.
Biztonsági elemzés és elemző (parser) támadási vektorok
A sima szöveges fájlok nem tartalmaznak futtatható kódot, de a rosszindulatú Unicode karakterek tévútra vezethetnek felhasználókat vagy terminál-injekciót okozhatnak.
Ismert támadási vektorok
- Jobbról balra felülbíráló (RTLO) Unicode karakterek, amelyek hamisítják a futtatható fájlkiterjesztéseket (pl. 'report[RTLO]cod.exe').
- Terminál vezérlősorozat-injekció, amely shell parancsokat hajt végre a nyers szöveg 'cat' paranccsal történő megtekintésekor.
- Homoglif támadások, amelyek a szabványos ASCII betűket azonosnak tűnő cirill karakterekkel helyettesítik az URL-ekben.
Védekező Legjobb Gyakorlatok:
Történeti háttér és mérföldkövek
Főbb előnyök
- Abszolút univerzális kompatibilitás: minden eddig megépített számítástechnikai eszközön megnyitható, szerkeszthető és kereshető.
- Tartós archiválási állandóság: a ma létrehozott sima szöveges fájl az eljövendő évszázadokban is 100%-ban olvasható marad.
- Nulla formátumtiszta rezsi: tiszta adatokat tartalmaz nulla metaadat-felesleggel, bináris címkékkel vagy saját tulajdonú struktúrákkal.
Technikai korlátok és hátrányok
- Nulla vizuális formázás: külső leíró nyelv nélkül nem tud natívan félkövér, dőlt, színes vagy betűméret-módosítást végezni.
- A platformok közötti sorsorvégek különbségei (Windows CRLF vs Unix LF) formázási hibákat okozhatnak az operációs rendszerek között.
- A történelmi kódolási kétértelműségek (ANSI, Shift-JIS, Windows-1252) karaktertorzulást (mojibake) okozhatnak UTF-8 nélkül.
Érdekes technikai tudnivalók
- Az UTF-8-at egy New Jersey-i dinerben találták fel egy alátéten 1992-ben Ken Thompson és Rob Pike vacsora közben.
- A Windows két karaktert használ új sornak: Kocsi Vissza (CR, 0x0D) és Sorvezető (LF, 0x0A), ami a mechanikus írógépek öröksége.
- Az interneten található összes webhely több mint 98%-a UTF-8 szövegkódolást használ.
Gyakran Ismételt Műszaki Kérdések
Mi az a UTF-8?
Az UTF-8 az univerzális karakterkódolási szabvány, amely minden betűt, számot, szimbólumot és emojit képes ábrázolni az összes emberi nyelven, miközben 100%-ban visszafelé kompatibilis marad az ASCII-vel.
Mi a különbség a Windows és a Unix sorvégek között?
A Windows a 'CRLF'-et (két bájt: Carriage Return + Line Feed) használja új sor jelölésére, míg a Unix, a Linux és a macOS az 'LF'-et (egyetlen Line Feed bájtot).
Hogyan konvertálhatok át egy TXT fájlt PDF-be?
Egyetlen kattintással konvertálhatsz sima szöveges fájlokat tiszta, professzionális PDF-dokumentumokká vagy Word-dokumentumokká a File2File.app segítségével közvetlenül a webböngésződben.
Kapcsolódó TXT konverziós párok
A SubRip Text feliratfájlok sima szöveges átirattá alakítása eltávolítja az időzítési kódokat és a sorszámokat, tiszta, jól olvasható dokumentumot hozva létre.
A beolvasott kép szöveggé alakítása a képpontokat szerkeszthető karakterekké fordítja, így a szavak könnyen kereshetők, szerkeszthetők és tárolhatók lesznek.
A raszteres PNG képdokumentumok sima szöveggé alakítása az optikai karakterfelismerés segítségével a statikus képpixeleket szerkeszthető szavakká alakítja.