Sequenza FASTA (.fasta)
Bioinformatics StandardFASTA è il formato di file onnipresente e fondamentale della bioinformatica e della genomica, che rappresenta sequenze nucleotidiche (DNA, RNA) e sequenze di amminoacidi proteici utilizzando codici universali a lettera singola.
Converti da FASTA a GENBANK
Convertitore gratuito da FASTA a GENBANK nel browser. Converti i file istantaneamente sul tuo dispositivo.
Ispeziona e metadati
I sistemi operativi e gli analizzatori di file identificano i file FASTA ispezionando la sequenza di byte binari iniziale:
Firma dell'intestazione a livello di byte (Magic Bytes)
I sistemi operativi e gli analizzatori di file identificano i file FASTA ispezionando la sequenza di byte binari iniziale:
FIRMA ESADECIMALE (OFFSET 0):
3ERAPPRESENTAZIONE ASCII: >
Standardizzazione: Bioinformatics de facto global standard
Specifiche tecniche
| Architettura del container | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Compressione | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Endianness dei byte | ASCII / UTF-8 text stream |
| Spazi colore | N/A (Genomic Sequence Data) |
| Canali e struttura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Dimensioni massime | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Trasparenza | None |
| Streaming e progressivo | Sequential record-by-record streaming processing |
Matrice di confronto tecnico: FASTA vs Concorrenti
| Attributo tecnico | FASTA (Corrente) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Punteggi di qualità | Nessuno (lettere di sequenza pura) | Punteggi di qualità Phred per base | Nessuno (annotazioni di caratteristiche) | Nessuno (coordinate di caratteristiche) |
| Riga di intestazione | Inizia con il carattere '>' | Inizia con il carattere '@' | Blocco LOCUS strutturato | Colonne genomiche delimitate da tabulazioni |
| Uso principale | Genomi di riferimento e ricerca BLAST | Sequenziatori grezzi ad alto rendimento (Illumina) | Geni annotati completi | Annotazioni di caratteristiche genomiche |
| Dimensioni del file (Umano) | ~3 Gigabyte non compresso | ~100+ Gigabyte (con qualità) | Testo ricco di diversi gigabyte | ~50 Megabyte |
Modalità di corruzione comuni e guida al recupero Hex
Lo strumento bioinformatico segnala 'Carattere di sequenza non valido alla riga X'.
Causa principale: Spazi bianchi, numeri o caratteri non IUPAC all'interno delle righe di sequenza.
Ripristino: Filtra e pulisci i caratteri di sequenza usando File2File Bioinformatics Tool.
Analisi di sicurezza e vettori di attacco del parser
Gli strumenti di genomica analizzano enormi file FASTA di diversi gigabyte in cui possono verificarsi integer overflow durante l'indicizzazione delle coordinate delle sequenze.
Vettori di attacco noti
- Integer overflow negli indicizzatori di sequenza a 32 bit (FAI) che superano 2^31 coppie di basi.
- Buffer overflow durante la lettura di intestazioni di identificatori di sequenza eccessivamente lunghe.
- Denial of service tramite query di allineamento patologiche.
Migliori pratiche difensive:
Origini storiche e tappe fondamentali
Vantaggi principali e pro
- Lo standard globale indiscusso della biologia computazionale: utilizzato da ogni strumento genomico, sequenziatore e database sulla Terra.
- Estrema semplicità: la riga 1 inizia con '>' seguita da un ID, seguita da lettere genetiche in testo semplice.
- Capacità multi-sequenza: un singolo file può contenere migliaia di singoli geni o genomi virali completi.
Limiti tecnici e svantaggi
- Non contiene punteggi di qualità del sequenziamento (a differenza di FASTQ, che memorizza i punteggi di confidenza Phred per base).
- Nessuna sintassi di metadati standardizzata per le righe di intestazione oltre all'identificatore iniziale.
- Enorme footprint di archiviazione per set di dati di interi genomi senza Gzip o compressione genomica specializzata.
Curiosità tecniche interessanti
- L'intero genoma umano di 3 miliardi di coppie di basi può essere rappresentato in formato FASTA, occupando circa 3 gigabyte di spazio di archiviazione.
- Le quattro lettere del DNA memorizzate nei file FASTA sono A (Adenina), C (Citosina), G (Guanina) e T (Timina).
- Quando il genoma del coronavirus COVID-19 è stato sequenziato per la prima volta nel gennaio 2020, gli scienziati lo hanno condiviso globalmente come un file FASTA di 30.000 lettere.
Domande tecniche frequenti
Cos'è un file FASTA?
Un file FASTA è un file di testo semplice utilizzato in biologia per memorizzare sequenze di DNA, RNA o proteine utilizzando abbreviazioni a lettera singola.
Qual è la differenza tra FASTA e FASTQ?
FASTA memorizza solo le lettere della sequenza genetica, mentre FASTQ memorizza sia le lettere che il punteggio di qualità dell'accuratezza del sequenziamento per ciascuna base.
Come posso visualizzare un file FASTA?
Puoi aprire i file FASTA in qualsiasi editor di testo, visualizzarli in software di bioinformatica come Jalview o UGENE, oppure convertirli utilizzando File2File.app.
Coppie di conversione per FASTA correlate
La conversione di una sequenza FASTA semplice in un flatfile GenBank aggiunge annotazioni biologiche essenziali e metadati al codice genetico grezzo.
La conversione di un flatfile GenBank in una sequenza FASTA rimuove i metadati di annotazione per lasciare solo le sequenze grezze di nucleotidi o amminoacidi necessarie per una rapida analisi bioinformatica.