File di Testo (.txt)
ISO/IEC StandardIl file di testo semplice (TXT) è la base universale dell'informatica digitale e della memorizzazione delle informazioni umane, contenente caratteri grezzi e non formattati che possono essere letti da qualsiasi sistema operativo e linguaggio di programmazione esistente.
Converti da SRT a TXT
Convertitore gratuito da SRT a TXT nel browser. Converti i file istantaneamente sul tuo dispositivo.
Ispeziona e metadati
I sistemi operativi e gli analizzatori di file identificano i file TXT ispezionando la sequenza di byte binari iniziale:
Firma dell'intestazione a livello di byte (Magic Bytes)
I sistemi operativi e gli analizzatori di file identificano i file TXT ispezionando la sequenza di byte binari iniziale:
FIRMA ESADECIMALE (OFFSET 0):
EF BB BF / NessunoRAPPRESENTAZIONE ASCII: BOM UTF-8 / Testo grezzo
Standardizzazione: ISO/IEC 10646 / Unicode Standard / IETF RFC 2046
Specifiche tecniche
| Architettura del container | Sequenza sequenziale di caratteri leggibili dall'uomo codificati come ASCII, UTF-8, UTF-16 o ISO-8859 |
| Compressione | Byte di caratteri grezzi non compressi |
| Endianness dei byte | UTF-8 (indipendente dall'ordine dei byte); Big/Little-Endian indicato dal BOM in UTF-16/32 |
| Spazi colore | N/D (Testo semplice) |
| Canali e struttura | Flusso lineare di caratteri, marcatori di nuova riga (LF \n o CRLF \r\n) e spazi bianchi |
| Dimensioni massime | Lunghezza del flusso illimitata |
| Trasparenza | Nessuna |
| Streaming e progressivo | Streaming universale immediato byte per byte |
Matrice di confronto tecnico: TXT vs Concorrenti
| Attributo tecnico | TXT (Corrente) | MD | HTML | |
|---|---|---|---|---|
| Formattazione visiva | Nessuna (puro testo senza stili) | Sintassi Markdown leggera | Layout visivo di pagina fisso | Stile CSS e DOM completo |
| Software richiesto | Nessuno (qualsiasi terminale o editor di testo) | Visualizzatore / lettore Markdown | Lettore PDF dedicato | Browser Web |
| Dimensione del file | Minima assoluta possibile | Dimensione di testo minima | Grande contenitore binario | Overhead di markup moderato |
| Longevità dell'archivio | Infinita (puri byte di caratteri) | Permanente (testo semplice) | Alta (standard ISO) | Alta (standard W3C) |
Modalità di corruzione comuni e guida al recupero Hex
Le lettere accentate vengono visualizzate come simboli illeggibili come 'é' o punti interrogativi neri ''.
Causa principale: Disallineamento della codifica: un file ANSI/Windows-1252 meno recente aperto come UTF-8 senza la conversione appropriata.
Ripristino: Riconverti il file specificando esplicitamente la codifica UTF-8 utilizzando il convertitore di testo di File2File.
Analisi di sicurezza e vettori di attacco del parser
I file di testo semplice non contengono codice eseguibile, ma caratteri unicode malevoli possono ingannare gli utenti o causare l'iniezione nel terminale.
Vettori di attacco noti
- Caratteri unicode Right-to-Left Override (RTLO) che falsificano le estensioni di file eseguibili (ad es. 'report[RTLO]cod.exe').
- Iniezione di sequenze di escape del terminale che eseguono comandi della shell quando si visualizza il testo grezzo tramite 'cat'.
- Attacchi di omoglifo che sostituiscono le lettere ASCII standard con caratteri cirillici identici nell'aspetto all'interno degli URL.
Migliori pratiche difensive: Sanitizza i caratteri di controllo unicode bidirezionali e i codici di escape del terminale durante il rendering dei file di testo.
Origini storiche e tappe fondamentali
Vantaggi principali e pro
- Compatibilità universale assoluta: può essere aperto, modificato e cercato su qualsiasi dispositivo informatico mai costruito.
- Permanenza di archiviazione duratura: un file di testo semplice creato oggi rimarrà leggibile al 100% per i secoli futuri.
- Zero overhead di formato: contiene dati puri senza alcuno spreco di metadati, tag binari o strutture proprietarie.
Limiti tecnici e svantaggi
- Zero formattazione visiva: non può applicare nativamente grassetto, corsivo, colori o modifiche alle dimensioni dei caratteri senza un linguaggio di markup esterno.
- Le differenze di fine riga tra piattaforme (Windows CRLF vs Unix LF) possono causare problemi di formattazione tra diversi sistemi operativi.
- Le ambiguità di codifica storiche (ANSI, Shift-JIS, Windows-1252) possono causare la corruzione dei caratteri (mojibake) senza l'uso di UTF-8.
Curiosità tecniche interessanti
- L'UTF-8 è stato inventato su una tovaglietta di carta in una tavola calda del New Jersey nel 1992 da Ken Thompson e Rob Pike durante la cena.
- Windows utilizza due caratteri per una nuova riga: Carriage Return (CR, 0x0D) e Line Feed (LF, 0x0A), un'eredità delle macchine da scrivere meccaniche.
- Oltre il 98% di tutti i siti Web su Internet utilizza la codifica di testo UTF-8.
Domande tecniche frequenti
Cos'è l'UTF-8?
L'UTF-8 è lo standard di codifica dei caratteri universale in grado di rappresentare qualsiasi lettera, numero, simbolo ed emoji in tutte le lingue umane, pur rimanendo retrocompatibile al 100% con l'ASCII.
Qual è la differenza tra i fine riga di Windows e Unix?
Windows usa 'CRLF' (due byte: Carriage Return + Line Feed) per rappresentare un'interruzione di riga, mentre Unix, Linux e macOS usano 'LF' (un singolo byte Line Feed).
Come posso convertire un file TXT in PDF?
Puoi convertire file di testo semplice in documenti PDF o Word puliti e professionali con un solo clic utilizzando File2File.app direttamente nel tuo browser web.
Coppie di conversione per TXT correlate
La conversione di file di sottotitoli SRT in trascrizioni TXT rimuove i codici temporali e i numeri di indice per lasciare dialoghi puliti e leggibili.
La conversione di un'immagine scansionata in testo estratto traduce i pixel dell'immagine in caratteri modificabili in modo da poter cercare, modificare e archiviare parole facilmente.
La conversione di un documento raster PNG in testo semplice trasforma i pixel di un'immagine statica in parole modificabili tramite il riconoscimento ottico dei caratteri.