Secuencia FASTA (.fasta)

Estándar Estándar

FASTA es el formato de archivo ubicuo y fundamental de la bioinformática y la genómica, que representa secuencias de nucleótidos (ADN, ARN) y secuencias de proteínas de aminoácidos utilizando códigos universales de una sola letra.

Convertir de FASTA a GENBANK

Convertidor gratuito de FASTA a GENBANK en el navegador. Convierte archivos al instante en tu dispositivo.

Inspeccionar y metadatos

Los sistemas operativos y analizadores de archivos identifican los archivos de FASTA inspeccionando la secuencia de bytes binarios inicial:

Selecciona o arrastra archivos aquí

Conversión 100% privada en el navegador; los archivos nunca salen de tu dispositivo

o pega Ctrl+V
Garantía de privacidad sin transmisión de red: 0 bytes subidos a servidores externos. Todo el procesamiento se realizó de forma local en el entorno seguro de tu navegador.

Firma de cabecera a nivel de bytes (Bytes mágicos)

Los sistemas operativos y analizadores de archivos identifican los archivos de FASTA inspeccionando la secuencia de bytes binarios inicial:

FIRMA HEXADECIMAL (DESPLAZAMIENTO 0):

3E

REPRESENTACIÓN ASCII: >

Estandarización: Estándar global de facto en bioinformática

Especificaciones técnicas

Arquitectura del contenedorArchivo de secuencia de texto plano donde las líneas de encabezado comienzan con '>' seguidas de un identificador de secuencia, y las líneas siguientes contienen códigos de nucleótidos o aminoácidos de una sola letra
CompresiónTexto sin comprimir (frecuentemente comprimido con Gzip como .fasta.gz o .fa.gz)
Orden de bytes (Endianness)Flujo de texto ASCII / UTF-8
Espacios de colorN/D (Datos de secuencias genómicas)
Canales y estructuraCódigos de ácidos nucleicos (A, C, G, T, U, N) o códigos de proteínas de 20 aminoácidos IUPAC
Dimensiones máximasLongitud de secuencia ilimitada (admite cromosomas humanos completos de más de 250 millones de pares de bases)
TransparenciaNinguna
Streaming y progresivoProcesamiento de transmisión secuencial registro por registro

Matriz de comparación técnica: FASTA frente a la competencia

Atributo técnicoFASTA (Actual)FASTQGENBANKGFF
Puntuaciones de CalidadNinguna (letras de secuencia pura)Puntuaciones de calidad Phred por baseNinguna (anotaciones de características)Ninguna (coordenadas de características)
Línea de EncabezadoComienza con el carácter '>'Comienza con el carácter '@'Bloque LOCUS estructuradoColumnas genómicas delimitadas por tabulaciones
Uso PrincipalGenomas de referencia y búsqueda BLASTSecuenciadores de alto rendimiento en bruto (Illumina)Genes anotados completosAnotaciones de características genómicas
Tamaño de Archivo (Humano)~3 Gigabytes sin comprimir~100+ Gigabytes (con calidades)Texto enriquecido de varios gigabytes~50 Megabytes

Modos de corrupción comunes y guía de recuperación hexadecimal

La herramienta bioinformática informa 'Carácter de secuencia no válido en la línea X'.

Causa raíz: Espacios en blanco, números o caracteres que no pertenecen a la IUPAC dentro de las líneas de secuencia.

Recuperación: Filtre y limpie los caracteres de secuencia utilizando la herramienta bioinformática de File2File.

Análisis de seguridad y vectores de ataque al analizador

Las herramientas genómicas analizan archivos FASTA masivos de varios gigabytes donde pueden ocurrir desbordamientos de enteros al indexar las coordenadas de las secuencias.

Vectores de ataque conocidos

  • Desbordamiento de enteros en indexadores de secuencias de 32 bits (FAI) que superan los 2^31 pares de bases.
  • Desbordamiento de búfer al leer encabezados de identificadores de secuencia excesivamente largos.
  • Denegación de servicio a través de consultas de alineación patológicas.

Mejores prácticas defensivas: Utilice tipos de coordenadas de 64 bits y aplique validación de longitud máxima de encabezado.

Orígenes históricos e hitos

2003El Proyecto Genoma Humano completa la primera secuenciación del genoma humano, publicando los resultados en formato FASTA.
1990BLAST (Basic Local Alignment Search Tool) adopta FASTA como su formato de entrada estándar.
1985William Pearson y David Lipman introducen FASTA con el software de alineación de secuencias FASTP.

Ventajas clave y pros

  • El estándar global indiscutible de la biología computacional: utilizado por todas las herramientas genómicas, secuenciadores y bases de datos del planeta.
  • Extrema simplicidad: la línea 1 comienza con '>' seguida de un ID, seguido de letras genéticas en texto plano.
  • Capacidad para múltiples secuencias: un solo archivo puede contener miles de genes individuales o genomas virales completos.

Limitaciones técnicas y contras

  • No contiene puntuaciones de calidad de secuenciación (a diferencia de FASTQ, que almacena puntuaciones de confianza Phred por base).
  • Sin sintaxis de metadatos estandarizada para líneas de encabezado más allá del identificador inicial.
  • Enorme huella de almacenamiento para conjuntos de datos de genoma completo sin Gzip o compresión genómica especializada.

Curiosidades técnicas interesantes

  • Todo el genoma humano de 3 mil millones de pares de bases se puede representar en formato FASTA, ocupando aproximadamente 3 gigabytes de almacenamiento.
  • Las cuatro letras del ADN almacenadas en archivos FASTA son A (Adenina), C (Citosina), G (Guanina) y T (Timina).
  • Cuando se secuenció por primera vez el genoma del coronavirus COVID-19 en enero de 2020, los científicos lo compartieron globalmente como un archivo FASTA de 30,000 letras.

Preguntas técnicas frecuentes

¿Qué es un archivo FASTA?

Un archivo FASTA es un archivo de texto plano utilizado en biología para almacenar secuencias de ADN, ARN o proteínas utilizando abreviaturas de una sola letra.

¿Cuál es la diferencia entre FASTA y FASTQ?

FASTA almacena únicamente las letras de la secuencia genética, mientras que FASTQ almacena tanto las letras como la puntuación de calidad de precisión de secuenciación para cada base.

¿Cómo puedo ver un archivo FASTA?

Puede abrir archivos FASTA en cualquier editor de texto, verlos en software bioinformático como Jalview o UGENE, o convertirlos usando File2File.app.