Séquence FASTA (.fasta)
Standard StandardFASTA est le format de fichier omniprésent et fondamental de la bioinformatique et de la génomique, représentant des séquences de nucléotides (ADN, ARN) et des séquences de protéines d'acides aminés à l'aide de codes universels à une lettre.
Convertir FASTA en GENBANK
Convertisseur gratuit de FASTA vers GENBANK dans le navigateur. Convertissez des fichiers instantanément sur votre appareil.
Inspecter et métadonnées
Les systèmes d'exploitation et les analyseurs de fichiers identifient les fichiers FASTA en inspectant la séquence d'octets binaires de tête :
Signature d'en-tête au niveau des octets (Magic Bytes)
Les systèmes d'exploitation et les analyseurs de fichiers identifient les fichiers FASTA en inspectant la séquence d'octets binaires de tête :
SIGNATURE HEXADÉCIMALE (DÉCALAGE 0) :
3EREPRÉSENTATION ASCII : >
Normalisation : Standard mondial de facto en bioinformatique
Spécifications techniques
| Architecture de conteneur | Fichier de séquence en texte brut où les lignes d'en-tête commencent par '>' suivi d'un identifiant de séquence, et les lignes suivantes contiennent des codes de nucléotides ou d'acides aminés à une seule lettre |
| Compression | Texte non compressé (fréquemment compressé avec Gzip sous forme de .fasta.gz ou .fa.gz) |
| Boutisme des octets | Flux de texte ASCII / UTF-8 |
| Espaces colorimétriques | N/A (Données de séquence génomique) |
| Canaux et structure | Codes d'acides nucléiques (A, C, G, T, U, N) ou codes de protéines à 20 acides aminés IUPAC |
| Dimensions maximales | Longueur de séquence illimitée (prend en charge des chromosomes humains entiers de plus de 250 millions de paires de bases) |
| Transparence | Aucune |
| Streaming et progressif | Traitement de streaming séquentiel enregistrement par enregistrement |
Matrice de comparaison technique : FASTA vs Concurrents
| Attribut technique | FASTA (Actuel) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Scores de qualité | Aucun (lettres de séquence pures) | Scores de qualité Phred par base | Aucun (annotations de fonctionnalités) | Aucun (coordonnées de fonctionnalités) |
| Ligne d'en-tête | Commence par le caractère '>' | Commence par le caractère '@' | Bloc LOCUS structuré | Colonnes génomiques délimitées par des tabulations |
| Utilisation principale | Génomes de référence & recherche BLAST | Séquenceurs bruts à haut débit (Illumina) | Gènes annotés complets | Annotations de fonctionnalités génomiques |
| Taille de fichier (Humain) | ~3 gigaoctets non compressés | ~100+ gigaoctets (avec qualités) | Texte riche de plusieurs gigaoctets | ~50 mégaoctets |
Modes de corruption courants et guide de récupération hexadécimale
L'outil bioinformatique signale 'Caractère de séquence invalide à la ligne X'.
Cause racine: Espace, chiffres ou caractères non-IUPAC à l'intérieur des lignes de séquence.
Récupération: Filtrer et nettoyer les caractères de séquence à l'aide de l'outil bioinformatique File2File.
Analyse de sécurité et vecteurs d'attaque de l'analyseur
Les outils de génomique analysent des fichiers FASTA massifs de plusieurs gigaoctets où des dépassements d'entiers peuvent se produire lors de l'indexation des coordonnées de séquence.
Vecteurs d'attaque connus
- Dépassement d'entier dans les indexeurs de séquences 32 bits (FAI) dépassant 2^31 paires de bases.
- Dépassement de tampon lors de la lecture d'en-têtes d'identifiants de séquence excessivement longs.
- Déni de service par le biais de requêtes d'alignement pathologiques.
Bonnes pratiques de défense: Utiliser des types de coordonnées 64 bits et appliquer une validation de la longueur maximale de l'en-tête.
Origines historiques et jalons
Principaux avantages
- Le standard mondial incontesté de la biologie computationnelle : utilisé par tous les outils génomiques, séquenceurs et bases de données sur Terre.
- Extrême simplicité : la ligne 1 commence par '>' suivi d'un identifiant, puis des lettres génétiques en texte brut.
- Capacité multi-séquence : un seul fichier peut contenir des milliers de gènes individuels ou des génomes viraux complets.
Limites techniques
- Ne contient aucun score de qualité de séquençage (contrairement à FASTQ, qui stocke les scores de confiance Phred par base).
- Aucune syntaxe de métadonnées standardisée pour les lignes d'en-tête au-delà de l'identifiant initial.
- Empreinte de stockage énorme pour les ensembles de données de génome entier sans Gzip ou compression génomique spécialisée.
Anecdotes techniques
- Le génome humain entier de 3 milliards de paires de bases peut être représenté au format FASTA, occupant environ 3 gigaoctets de stockage.
- Les quatre lettres de l'ADN stockées dans les fichiers FASTA sont A (Adénine), C (Cytosine), G (Guanine) et T (Thymine).
- Lorsque le génome du coronavirus COVID-19 a été séquencé pour la première fois en janvier 2020, les scientifiques l'ont partagé mondialement sous forme de fichier FASTA de 30 000 lettres.
Foire aux questions techniques
Qu'est-ce qu'un fichier FASTA ?
Un fichier FASTA est un fichier texte brut utilisé en biologie pour stocker des séquences d'ADN, d'ARN ou de protéines à l'aide d'abréviations à une seule lettre.
Quelle est la différence entre FASTA et FASTQ ?
FASTA stocke uniquement les lettres de la séquence génétique, tandis que FASTQ stocke à la fois les lettres et le score de qualité de précision du séquençage pour chaque base.
Comment puis-je visualiser un fichier FASTA ?
Vous pouvez ouvrir des fichiers FASTA dans n'importe quel éditeur de texte, les visualiser dans un logiciel de bioinformatique comme Jalview ou UGENE, ou les convertir à l'aide de File2File.app.
Paires de conversion FASTA associées
La conversion d'une séquence FASTA simple en un fichier plat GenBank ajoute des annotations biologiques essentielles et des métadonnées au code génétique brut.
La conversion d'un fichier plat GenBank en séquence FASTA élimine les métadonnées d'annotation pour ne laisser que les séquences brutes de nucléotides ou d'acides aminés nécessaires à une analyse bio-informatique rapide.