Séquence FASTA (.fasta)

Standard Standard

FASTA est le format de fichier omniprésent et fondamental de la bioinformatique et de la génomique, représentant des séquences de nucléotides (ADN, ARN) et des séquences de protéines d'acides aminés à l'aide de codes universels à une lettre.

Convertir FASTA en GENBANK

Convertisseur gratuit de FASTA vers GENBANK dans le navigateur. Convertissez des fichiers instantanément sur votre appareil.

Inspecter et métadonnées

Les systèmes d'exploitation et les analyseurs de fichiers identifient les fichiers FASTA en inspectant la séquence d'octets binaires de tête :

Sélectionnez ou déposez des fichiers ici

Conversion 100 % privée dans le navigateur - les fichiers ne quittent jamais votre appareil

ou coller Ctrl+V
Garantie de confidentialité sans transmission réseau : 0 octet téléchargé vers des serveurs externes. Tout le traitement a lieu localement dans le bac à sable de votre navigateur.

Signature d'en-tête au niveau des octets (Magic Bytes)

Les systèmes d'exploitation et les analyseurs de fichiers identifient les fichiers FASTA en inspectant la séquence d'octets binaires de tête :

SIGNATURE HEXADÉCIMALE (DÉCALAGE 0) :

3E

REPRÉSENTATION ASCII : >

Normalisation : Standard mondial de facto en bioinformatique

Spécifications techniques

Architecture de conteneurFichier de séquence en texte brut où les lignes d'en-tête commencent par '>' suivi d'un identifiant de séquence, et les lignes suivantes contiennent des codes de nucléotides ou d'acides aminés à une seule lettre
CompressionTexte non compressé (fréquemment compressé avec Gzip sous forme de .fasta.gz ou .fa.gz)
Boutisme des octetsFlux de texte ASCII / UTF-8
Espaces colorimétriquesN/A (Données de séquence génomique)
Canaux et structureCodes d'acides nucléiques (A, C, G, T, U, N) ou codes de protéines à 20 acides aminés IUPAC
Dimensions maximalesLongueur de séquence illimitée (prend en charge des chromosomes humains entiers de plus de 250 millions de paires de bases)
TransparenceAucune
Streaming et progressifTraitement de streaming séquentiel enregistrement par enregistrement

Matrice de comparaison technique : FASTA vs Concurrents

Attribut techniqueFASTA (Actuel)FASTQGENBANKGFF
Scores de qualitéAucun (lettres de séquence pures)Scores de qualité Phred par baseAucun (annotations de fonctionnalités)Aucun (coordonnées de fonctionnalités)
Ligne d'en-têteCommence par le caractère '>'Commence par le caractère '@'Bloc LOCUS structuréColonnes génomiques délimitées par des tabulations
Utilisation principaleGénomes de référence & recherche BLASTSéquenceurs bruts à haut débit (Illumina)Gènes annotés completsAnnotations de fonctionnalités génomiques
Taille de fichier (Humain)~3 gigaoctets non compressés~100+ gigaoctets (avec qualités)Texte riche de plusieurs gigaoctets~50 mégaoctets

Modes de corruption courants et guide de récupération hexadécimale

L'outil bioinformatique signale 'Caractère de séquence invalide à la ligne X'.

Cause racine: Espace, chiffres ou caractères non-IUPAC à l'intérieur des lignes de séquence.

Récupération: Filtrer et nettoyer les caractères de séquence à l'aide de l'outil bioinformatique File2File.

Analyse de sécurité et vecteurs d'attaque de l'analyseur

Les outils de génomique analysent des fichiers FASTA massifs de plusieurs gigaoctets où des dépassements d'entiers peuvent se produire lors de l'indexation des coordonnées de séquence.

Vecteurs d'attaque connus

  • Dépassement d'entier dans les indexeurs de séquences 32 bits (FAI) dépassant 2^31 paires de bases.
  • Dépassement de tampon lors de la lecture d'en-têtes d'identifiants de séquence excessivement longs.
  • Déni de service par le biais de requêtes d'alignement pathologiques.

Bonnes pratiques de défense: Utiliser des types de coordonnées 64 bits et appliquer une validation de la longueur maximale de l'en-tête.

Origines historiques et jalons

2003Le projet du génome humain achève le premier séquençage du génome humain, publiant les résultats au format FASTA.
1990BLAST (Basic Local Alignment Search Tool) adopte FASTA comme format d'entrée standard.
1985William Pearson et David Lipman introduisent FASTA avec le logiciel d'alignement de séquences FASTP.

Principaux avantages

  • Le standard mondial incontesté de la biologie computationnelle : utilisé par tous les outils génomiques, séquenceurs et bases de données sur Terre.
  • Extrême simplicité : la ligne 1 commence par '>' suivi d'un identifiant, puis des lettres génétiques en texte brut.
  • Capacité multi-séquence : un seul fichier peut contenir des milliers de gènes individuels ou des génomes viraux complets.

Limites techniques

  • Ne contient aucun score de qualité de séquençage (contrairement à FASTQ, qui stocke les scores de confiance Phred par base).
  • Aucune syntaxe de métadonnées standardisée pour les lignes d'en-tête au-delà de l'identifiant initial.
  • Empreinte de stockage énorme pour les ensembles de données de génome entier sans Gzip ou compression génomique spécialisée.

Anecdotes techniques

  • Le génome humain entier de 3 milliards de paires de bases peut être représenté au format FASTA, occupant environ 3 gigaoctets de stockage.
  • Les quatre lettres de l'ADN stockées dans les fichiers FASTA sont A (Adénine), C (Cytosine), G (Guanine) et T (Thymine).
  • Lorsque le génome du coronavirus COVID-19 a été séquencé pour la première fois en janvier 2020, les scientifiques l'ont partagé mondialement sous forme de fichier FASTA de 30 000 lettres.

Foire aux questions techniques

Qu'est-ce qu'un fichier FASTA ?

Un fichier FASTA est un fichier texte brut utilisé en biologie pour stocker des séquences d'ADN, d'ARN ou de protéines à l'aide d'abréviations à une seule lettre.

Quelle est la différence entre FASTA et FASTQ ?

FASTA stocke uniquement les lettres de la séquence génétique, tandis que FASTQ stocke à la fois les lettres et le score de qualité de précision du séquençage pour chaque base.

Comment puis-je visualiser un fichier FASTA ?

Vous pouvez ouvrir des fichiers FASTA dans n'importe quel éditeur de texte, les visualiser dans un logiciel de bioinformatique comme Jalview ou UGENE, ou les convertir à l'aide de File2File.app.