Secuencia FASTA (.fasta)
Estándar EstándarFASTA es el formato de archivo ubicuo y fundamental de la bioinformática y la genómica, que representa secuencias de nucleótidos (ADN, ARN) y secuencias de proteínas de aminoácidos utilizando códigos universales de una sola letra.
Convertir de FASTA a GENBANK
Convertidor gratuito de FASTA a GENBANK en el navegador. Convierte archivos al instante en tu dispositivo.
Inspeccionar y metadatos
Los sistemas operativos y analizadores de archivos identifican los archivos de FASTA inspeccionando la secuencia de bytes binarios inicial:
Firma de cabecera a nivel de bytes (Bytes mágicos)
Los sistemas operativos y analizadores de archivos identifican los archivos de FASTA inspeccionando la secuencia de bytes binarios inicial:
FIRMA HEXADECIMAL (DESPLAZAMIENTO 0):
3EREPRESENTACIÓN ASCII: >
Estandarización: Estándar global de facto en bioinformática
Especificaciones técnicas
| Arquitectura del contenedor | Archivo de secuencia de texto plano donde las líneas de encabezado comienzan con '>' seguidas de un identificador de secuencia, y las líneas siguientes contienen códigos de nucleótidos o aminoácidos de una sola letra |
| Compresión | Texto sin comprimir (frecuentemente comprimido con Gzip como .fasta.gz o .fa.gz) |
| Orden de bytes (Endianness) | Flujo de texto ASCII / UTF-8 |
| Espacios de color | N/D (Datos de secuencias genómicas) |
| Canales y estructura | Códigos de ácidos nucleicos (A, C, G, T, U, N) o códigos de proteínas de 20 aminoácidos IUPAC |
| Dimensiones máximas | Longitud de secuencia ilimitada (admite cromosomas humanos completos de más de 250 millones de pares de bases) |
| Transparencia | Ninguna |
| Streaming y progresivo | Procesamiento de transmisión secuencial registro por registro |
Matriz de comparación técnica: FASTA frente a la competencia
| Atributo técnico | FASTA (Actual) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Puntuaciones de Calidad | Ninguna (letras de secuencia pura) | Puntuaciones de calidad Phred por base | Ninguna (anotaciones de características) | Ninguna (coordenadas de características) |
| Línea de Encabezado | Comienza con el carácter '>' | Comienza con el carácter '@' | Bloque LOCUS estructurado | Columnas genómicas delimitadas por tabulaciones |
| Uso Principal | Genomas de referencia y búsqueda BLAST | Secuenciadores de alto rendimiento en bruto (Illumina) | Genes anotados completos | Anotaciones de características genómicas |
| Tamaño de Archivo (Humano) | ~3 Gigabytes sin comprimir | ~100+ Gigabytes (con calidades) | Texto enriquecido de varios gigabytes | ~50 Megabytes |
Modos de corrupción comunes y guía de recuperación hexadecimal
La herramienta bioinformática informa 'Carácter de secuencia no válido en la línea X'.
Causa raíz: Espacios en blanco, números o caracteres que no pertenecen a la IUPAC dentro de las líneas de secuencia.
Recuperación: Filtre y limpie los caracteres de secuencia utilizando la herramienta bioinformática de File2File.
Análisis de seguridad y vectores de ataque al analizador
Las herramientas genómicas analizan archivos FASTA masivos de varios gigabytes donde pueden ocurrir desbordamientos de enteros al indexar las coordenadas de las secuencias.
Vectores de ataque conocidos
- Desbordamiento de enteros en indexadores de secuencias de 32 bits (FAI) que superan los 2^31 pares de bases.
- Desbordamiento de búfer al leer encabezados de identificadores de secuencia excesivamente largos.
- Denegación de servicio a través de consultas de alineación patológicas.
Mejores prácticas defensivas: Utilice tipos de coordenadas de 64 bits y aplique validación de longitud máxima de encabezado.
Orígenes históricos e hitos
Ventajas clave y pros
- El estándar global indiscutible de la biología computacional: utilizado por todas las herramientas genómicas, secuenciadores y bases de datos del planeta.
- Extrema simplicidad: la línea 1 comienza con '>' seguida de un ID, seguido de letras genéticas en texto plano.
- Capacidad para múltiples secuencias: un solo archivo puede contener miles de genes individuales o genomas virales completos.
Limitaciones técnicas y contras
- No contiene puntuaciones de calidad de secuenciación (a diferencia de FASTQ, que almacena puntuaciones de confianza Phred por base).
- Sin sintaxis de metadatos estandarizada para líneas de encabezado más allá del identificador inicial.
- Enorme huella de almacenamiento para conjuntos de datos de genoma completo sin Gzip o compresión genómica especializada.
Curiosidades técnicas interesantes
- Todo el genoma humano de 3 mil millones de pares de bases se puede representar en formato FASTA, ocupando aproximadamente 3 gigabytes de almacenamiento.
- Las cuatro letras del ADN almacenadas en archivos FASTA son A (Adenina), C (Citosina), G (Guanina) y T (Timina).
- Cuando se secuenció por primera vez el genoma del coronavirus COVID-19 en enero de 2020, los científicos lo compartieron globalmente como un archivo FASTA de 30,000 letras.
Preguntas técnicas frecuentes
¿Qué es un archivo FASTA?
Un archivo FASTA es un archivo de texto plano utilizado en biología para almacenar secuencias de ADN, ARN o proteínas utilizando abreviaturas de una sola letra.
¿Cuál es la diferencia entre FASTA y FASTQ?
FASTA almacena únicamente las letras de la secuencia genética, mientras que FASTQ almacena tanto las letras como la puntuación de calidad de precisión de secuenciación para cada base.
¿Cómo puedo ver un archivo FASTA?
Puede abrir archivos FASTA en cualquier editor de texto, verlos en software bioinformático como Jalview o UGENE, o convertirlos usando File2File.app.
Pares de conversión de FASTA relacionados
Convertir una secuencia FASTA plana en un archivo plano GenBank añade anotaciones biológicas esenciales y metadatos al código genético en bruto.
Convertir un archivo plano GenBank a una secuencia FASTA elimina los metadatos de anotación para dejar solo las secuencias de nucleótidos o aminoácidos en bruto necesarias para un análisis bioinformático rápido.