Fichier plat GenBank (.gb)
Spécification StandardLe fichier plat NCBI GenBank (.gb / .gbk) est le format d'annotation génomique de référence maintenu par les National Institutes of Health (NIH), combinant des séquences d'ADN complètes avec des emplacements de gènes détaillés, des régions codantes et des citations de littérature scientifique.
Convertir FASTA en GENBANK
Convertisseur gratuit de FASTA vers GENBANK dans le navigateur. Convertissez des fichiers instantanément sur votre appareil.
Inspecter et métadonnées
Les systèmes d'exploitation et les analyseurs de fichiers identifient les fichiers GenBank en inspectant la séquence d'octets binaires de tête :
Signature d'en-tête au niveau des octets (Magic Bytes)
Les systèmes d'exploitation et les analyseurs de fichiers identifient les fichiers GenBank en inspectant la séquence d'octets binaires de tête :
SIGNATURE HEXADÉCIMALE (DÉCALAGE 0) :
4C 4F 43 55 53 20 20 20 20 20REPRÉSENTATION ASCII : LOCUS
Normalisation : Spécification de version NCBI GenBank
Spécifications techniques
| Architecture de conteneur | Fichier plat en texte brut divisé en section d'en-tête (LOCUS, DEFINITION, ACCESSION), table FEATURES et données de séquence ORIGIN se terminant par '//' |
| Compression | Texte non compressé (souvent compressé avec Gzip sous forme de .gb.gz) |
| Boutisme des octets | Flux de texte UTF-8 / ASCII |
| Espaces colorimétriques | N/A (Base de données d'annotations génomiques) |
| Canaux et structure | Séquence ADN/ARN, annotations de gènes, régions codantes (CDS), traductions de protéines et citations scientifiques |
| Dimensions maximales | Séquence et nombre de fonctionnalités illimités |
| Transparence | Aucune |
| Streaming et progressif | Streaming enregistrement par enregistrement : les entrées GenBank individuelles sont délimitées par des lignes '//' |
Matrice de comparaison technique : GenBank vs Concurrents
| Attribut technique | GenBank (Actuel) | FASTA | GFF | FASTQ |
|---|---|---|---|---|
| Détail de l'annotation | Exhaustif (gènes, CDS, citations, traduction) | Aucun (séquence uniquement) | Coordonnées génomiques tabulaires | Scores de qualité de séquençage uniquement |
| Séquence incluse | Oui (dans le bloc ORIGIN à la fin) | Oui (séquence pure) | Non (coordonnées uniquement) | Oui (lectures brutes) |
| Outils principaux | NCBI, SnapGene, Benchling | BLAST, outils d'alignement | Navigateurs de génome (UCSC, IGV) | Séquenceurs Illumina |
| Terminateur d'enregistrement | // sur une ligne autonome | Ligne d'en-tête '>' suivante | Fin de fichier | Ligne '@' suivante |
Modes de corruption courants et guide de récupération hexadécimale
Le logiciel de bioinformatique signale 'Erreur de l'analyseur GenBank : EOF prématuré avant //'.
Cause racine: Téléchargement tronqué coupant le bloc d'origine de la séquence finale ou le délimiteur '//'.
Récupération: Ajouter '//\n' à la fin du fichier à l'aide de l'outil bioinformatique File2File.
Analyse de sécurité et vecteurs d'attaque de l'analyseur
Les analyseurs GenBank traitent des chaînes d'emplacement de fonctionnalités complexes où le retour en arrière des expressions régulières peut déclencher un déni de service.
Vecteurs d'attaque connus
- Déni de service par expression régulière (ReDoS) dans les analyseurs d'emplacement de fonctionnalités complexes.
- Dépassement de tampon lors de la lecture de titres de référence de citation excessivement longs.
- Déni de service par le biais de boucles de référence de fonctionnalités circulaires.
Bonnes pratiques de défense: Utiliser des analyseurs linéaires sans retour en arrière pour évaluer les plages de coordonnées de la table des fonctionnalités.
Origines historiques et jalons
Principaux avantages
- Métadonnées riches et complètes : stocke les limites des gènes, les emplacements des promoteurs, les exons, les introns et les séquences protéiques traduites.
- Comprend des références de littérature scientifique complètes, des identifiants PubMed, les noms des auteurs et les dates de soumission expérimentale.
- Format d'échange universel pour la biologie synthétique, la conception de plasmides (SnapGene) et les soumissions à la base de données NCBI.
Limites techniques
- Tailles de fichiers nettement plus verbeuses et plus grandes que les séquences FASTA pures.
- L'analyse des coordonnées de la table des fonctionnalités ('join(complement(100..500),600..800)') nécessite une logique d'analyseur syntaxique complexe.
- Non conçu pour l'alignement massif de lectures de séquençage à haut débit.
Anecdotes techniques
- Chaque entrée GenBank commence par le mot 'LOCUS' et se termine par deux slashes '//' sur une ligne isolée.
- GenBank synchronise ses données quotidiennement avec le Laboratoire européen de biologie moléculaire (EMBL) et la banque de données d'ADN du Japon (DDBJ).
- Les biologistes synthétiques utilisent des fichiers GenBank pour concevoir des plasmides circulaires personnalisés pour l'édition de gènes CRISPR et la production d'insuline.
Foire aux questions techniques
Quelle est la différence entre le format FASTA et le format GenBank ?
FASTA ne contient que la séquence d'ADN brute avec une brève ligne d'en-tête. GenBank contient la séquence brute PLUS toutes les annotations de gènes, les traductions de protéines, les auteurs et les notes scientifiques.
Comment puis-je convertir GenBank (.gb) en FASTA ?
Vous pouvez convertir des fichiers GenBank en séquences de nucléotides ou de protéines FASTA propres en un seul clic à l'aide de File2File.app directement dans votre navigateur.
Quel logiciel ouvre les fichiers GenBank ?
SnapGene, Benchling, UGENE, Artemis et File2File.app peuvent visualiser et éditer des fichiers GenBank.
Paires de conversion GenBank associées
La conversion d'une séquence FASTA simple en un fichier plat GenBank ajoute des annotations biologiques essentielles et des métadonnées au code génétique brut.
La conversion d'un fichier plat GenBank en séquence FASTA élimine les métadonnées d'annotation pour ne laisser que les séquences brutes de nucléotides ou d'acides aminés nécessaires à une analyse bio-informatique rapide.