GenBank plano (.gb)

Especificación Estándar

El Archivo Plano NCBI GenBank (.gb / .gbk) es el formato de anotación genómica estándar de oro mantenido por los Institutos Nacionales de Salud (NIH), que combina secuencias de ADN completas con ubicaciones detalladas de genes, regiones codificantes y citas de literatura científica.

Convertir de FASTA a GENBANK

Convertidor gratuito de FASTA a GENBANK en el navegador. Convierte archivos al instante en tu dispositivo.

Inspeccionar y metadatos

Los sistemas operativos y analizadores de archivos identifican los archivos de GenBank inspeccionando la secuencia de bytes binarios inicial:

Selecciona o arrastra archivos aquí

Conversión 100% privada en el navegador; los archivos nunca salen de tu dispositivo

o pega Ctrl+V
Garantía de privacidad sin transmisión de red: 0 bytes subidos a servidores externos. Todo el procesamiento se realizó de forma local en el entorno seguro de tu navegador.

Firma de cabecera a nivel de bytes (Bytes mágicos)

Los sistemas operativos y analizadores de archivos identifican los archivos de GenBank inspeccionando la secuencia de bytes binarios inicial:

FIRMA HEXADECIMAL (DESPLAZAMIENTO 0):

4C 4F 43 55 53 20 20 20 20 20

REPRESENTACIÓN ASCII: LOCUS

Estandarización: Especificación de Lanzamiento de NCBI GenBank

Especificaciones técnicas

Arquitectura del contenedorArchivo plano de texto plano dividido en la sección de Cabecera (LOCUS, DEFINITION, ACCESSION), la tabla FEATURES y los datos de la secuencia ORIGIN que terminan con '//'
CompresiónTexto sin comprimir (a menudo comprimido con Gzip como .gb.gz)
Orden de bytes (Endianness)Flujo de texto UTF-8 / ASCII
Espacios de colorN/A (Base de Datos de Anotación Genómica)
Canales y estructuraSecuencia de ADN/ARN, anotaciones de genes, regiones codificantes (CDS), traducciones de proteínas y citas científicas
Dimensiones máximasSecuencia y recuento de características ilimitados
TransparenciaNinguna
Streaming y progresivoTransmisión registro por registro: las entradas individuales de GenBank están delimitadas por líneas '//'

Matriz de comparación técnica: GenBank frente a la competencia

Atributo técnicoGenBank (Actual)FASTAGFFFASTQ
Detalle de AnotaciónExhaustivo (genes, CDS, citas, traducción)Ninguno (solo secuencia)Coordenadas genómicas tabularesSolo puntuaciones de calidad de secuenciación
Secuencia IncluidaSí (en bloque ORIGIN al final)Sí (secuencia pura)No (solo coordenadas)Sí (lecturas sin procesar)
Herramientas PrincipalesNCBI, SnapGene, BenchlingBLAST, herramientas de alineaciónVisores de genomas (UCSC, IGV)Secuenciadores Illumina
Terminador de Registro// en línea independienteSiguiente línea de cabecera '>'Fin de archivoSiguiente línea '@'

Modos de corrupción comunes y guía de recuperación hexadecimal

El software de bioinformática informa 'GenBank parser error: premature EOF before //'.

Causa raíz: Descarga truncada que corta el bloque de origen de la secuencia final o el delimitador '//'.

Recuperación: Agregue '//\n' al final del archivo utilizando la herramienta bioinformática de File2File.

Análisis de seguridad y vectores de ataque al analizador

Los analizadores de GenBank procesan cadenas complejas de ubicación de características donde el retroceso de expresiones regulares puede desencadenar denegación de servicio.

Vectores de ataque conocidos

  • Denegación de servicio por expresiones regulares (ReDoS) en analizadores complejos de ubicación de características.
  • Desbordamiento de búfer al leer títulos de referencia de citas excesivamente largos.
  • Denegación de servicio a través de bucles de referencia de características circulares.

Mejores prácticas defensivas: Utilice analizadores lineales sin retroceso para evaluar los rangos de coordenadas de la tabla de características.

Orígenes históricos e hitos

2023La base de datos GenBank supera los 2.5 mil millones de secuencias de nucleótidos y los 3 billones de pares de bases.
1992El NCBI asume la gestión completa de GenBank del Laboratorio Nacional de Los Álamos.
1982Establecido por Walter Goad en el Laboratorio Nacional de Los Álamos bajo financiación de los NIH.

Ventajas clave y pros

  • Metadatos comprensivos ricos: almacena límites de genes, ubicaciones de promotores, exones, intrones y secuencias de proteínas traducidas.
  • Incluye referencias de literatura científica completas, IDs de PubMed, nombres de autores y fechas de presentación experimental.
  • Formato de intercambio universal para biología sintética, diseño de plásmidos (SnapGene) y envíos a bases de datos del NCBI.

Limitaciones técnicas y contras

  • Tamaños de archivo significativamente más detallados y grandes que las secuencias FASTA puras.
  • Analizar las coordenadas de la tabla de características ('join(complement(100..500),600..800)') requiere lógica de análisis compleja.
  • No está diseñado para la alineación de lecturas de secuenciación masiva de alto rendimiento.

Curiosidades técnicas interesantes

  • Cada entrada de GenBank comienza con la palabra 'LOCUS' y concluye con dos barras diagonales '//' en una línea propia.
  • GenBank sincroniza sus datos diariamente con el Laboratorio Europeo de Biología Molecular (EMBL) y el Banco de Datos de ADN de Japón (DDBJ).
  • Los biólogos sintéticos utilizan archivos GenBank para diseñar plásmidos circulares personalizados para la edición genética CRISPR y la producción de insulina.

Preguntas técnicas frecuentes

¿Cuál es la diferencia entre el formato FASTA y GenBank?

FASTA contiene solo la secuencia de ADN sin procesar con una breve línea de cabecera. GenBank contiene la secuencia sin procesar MÁS todas las anotaciones de genes, traducciones de proteínas, autores y notas científicas.

¿Cómo puedo convertir GenBank (.gb) a FASTA?

Puede convertir archivos GenBank en secuencias de nucleótidos o proteínas FASTA limpias con un solo clic utilizando File2File.app directamente en su navegador.

¿Qué software abre archivos GenBank?

SnapGene, Benchling, UGENE, Artemis y File2File.app pueden ver y editar archivos GenBank.