Sequenza FASTA (.fasta)

Bioinformatics Standard

FASTA è il formato di file onnipresente e fondamentale della bioinformatica e della genomica, che rappresenta sequenze nucleotidiche (DNA, RNA) e sequenze di amminoacidi proteici utilizzando codici universali a lettera singola.

Converti da FASTA a GENBANK

Convertitore gratuito da FASTA a GENBANK nel browser. Converti i file istantaneamente sul tuo dispositivo.

Ispeziona e metadati

I sistemi operativi e gli analizzatori di file identificano i file FASTA ispezionando la sequenza di byte binari iniziale:

Seleziona o rilascia i file qui

Conversione 100% privata nel browser: i file non lasciano mai il tuo dispositivo

o incolla Ctrl+V
Garanzia di privacy con zero trasmissioni di rete: 0 byte caricati su server esterni. Tutta l'elaborazione è avvenuta localmente nella sandbox del tuo browser.

Firma dell'intestazione a livello di byte (Magic Bytes)

I sistemi operativi e gli analizzatori di file identificano i file FASTA ispezionando la sequenza di byte binari iniziale:

FIRMA ESADECIMALE (OFFSET 0):

3E

RAPPRESENTAZIONE ASCII: >

Standardizzazione: Bioinformatics de facto global standard

Specifiche tecniche

Architettura del containerPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
CompressioneUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Endianness dei byteASCII / UTF-8 text stream
Spazi coloreN/A (Genomic Sequence Data)
Canali e strutturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Dimensioni massimeUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TrasparenzaNone
Streaming e progressivoSequential record-by-record streaming processing

Matrice di confronto tecnico: FASTA vs Concorrenti

Attributo tecnicoFASTA (Corrente)FASTQGENBANKGFF
Punteggi di qualitàNessuno (lettere di sequenza pura)Punteggi di qualità Phred per baseNessuno (annotazioni di caratteristiche)Nessuno (coordinate di caratteristiche)
Riga di intestazioneInizia con il carattere '>'Inizia con il carattere '@'Blocco LOCUS strutturatoColonne genomiche delimitate da tabulazioni
Uso principaleGenomi di riferimento e ricerca BLASTSequenziatori grezzi ad alto rendimento (Illumina)Geni annotati completiAnnotazioni di caratteristiche genomiche
Dimensioni del file (Umano)~3 Gigabyte non compresso~100+ Gigabyte (con qualità)Testo ricco di diversi gigabyte~50 Megabyte

Modalità di corruzione comuni e guida al recupero Hex

Lo strumento bioinformatico segnala 'Carattere di sequenza non valido alla riga X'.

Causa principale: Spazi bianchi, numeri o caratteri non IUPAC all'interno delle righe di sequenza.

Ripristino: Filtra e pulisci i caratteri di sequenza usando File2File Bioinformatics Tool.

Analisi di sicurezza e vettori di attacco del parser

Gli strumenti di genomica analizzano enormi file FASTA di diversi gigabyte in cui possono verificarsi integer overflow durante l'indicizzazione delle coordinate delle sequenze.

Vettori di attacco noti

  • Integer overflow negli indicizzatori di sequenza a 32 bit (FAI) che superano 2^31 coppie di basi.
  • Buffer overflow durante la lettura di intestazioni di identificatori di sequenza eccessivamente lunghe.
  • Denial of service tramite query di allineamento patologiche.

Migliori pratiche difensive:

Origini storiche e tappe fondamentali

2003Il Progetto Genoma Umano completa il primo sequenziamento del genoma umano, pubblicando i risultati in formato FASTA.
1990BLAST (Basic Local Alignment Search Tool) adotta FASTA come formato di input standard.
1985William Pearson e David Lipman introducono FASTA con il software di allineamento di sequenze FASTP.

Vantaggi principali e pro

  • Lo standard globale indiscusso della biologia computazionale: utilizzato da ogni strumento genomico, sequenziatore e database sulla Terra.
  • Estrema semplicità: la riga 1 inizia con '>' seguita da un ID, seguita da lettere genetiche in testo semplice.
  • Capacità multi-sequenza: un singolo file può contenere migliaia di singoli geni o genomi virali completi.

Limiti tecnici e svantaggi

  • Non contiene punteggi di qualità del sequenziamento (a differenza di FASTQ, che memorizza i punteggi di confidenza Phred per base).
  • Nessuna sintassi di metadati standardizzata per le righe di intestazione oltre all'identificatore iniziale.
  • Enorme footprint di archiviazione per set di dati di interi genomi senza Gzip o compressione genomica specializzata.

Curiosità tecniche interessanti

  • L'intero genoma umano di 3 miliardi di coppie di basi può essere rappresentato in formato FASTA, occupando circa 3 gigabyte di spazio di archiviazione.
  • Le quattro lettere del DNA memorizzate nei file FASTA sono A (Adenina), C (Citosina), G (Guanina) e T (Timina).
  • Quando il genoma del coronavirus COVID-19 è stato sequenziato per la prima volta nel gennaio 2020, gli scienziati lo hanno condiviso globalmente come un file FASTA di 30.000 lettere.

Domande tecniche frequenti

Cos'è un file FASTA?

Un file FASTA è un file di testo semplice utilizzato in biologia per memorizzare sequenze di DNA, RNA o proteine utilizzando abbreviazioni a lettera singola.

Qual è la differenza tra FASTA e FASTQ?

FASTA memorizza solo le lettere della sequenza genetica, mentre FASTQ memorizza sia le lettere che il punteggio di qualità dell'accuratezza del sequenziamento per ciascuna base.

Come posso visualizzare un file FASTA?

Puoi aprire i file FASTA in qualsiasi editor di testo, visualizzarli in software di bioinformatica come Jalview o UGENE, oppure convertirli utilizzando File2File.app.