Secvență FASTA (.fasta)

Bioinformatics Standard

FASTA este formatul de fișier omniprezent și fundamental al bioinformaticii și genomicii, reprezentând secvențe de nucleotide (ADN, ARN) și secvențe de aminoacizi proteici folosind coduri universale cu o singură literă.

Convertește din FASTA în GENBANK

Convertor gratuit din FASTA în GENBANK direct în browser. Convertește fișiere instantaneu pe dispozitivul tău.

Inspectează și Metadate

Sistemele de operare și analizatoarele de fișiere identifică fișierele FASTA prin inspectarea secvenței binare inițiale:

Selectează sau plasează fișierele aici

Conversie 100% privată în browser - fișierele nu părăsesc niciodată dispozitivul tău

sau lipește Ctrl+V
Garanție de confidențialitate cu zero transmisie în rețea: 0 octeți încărcați pe servere externe. Toată procesarea a avut loc local în sandbox-ul browserului tău.

Semnătura antetului la nivel de octet (Magic Bytes)

Sistemele de operare și analizatoarele de fișiere identifică fișierele FASTA prin inspectarea secvenței binare inițiale:

SEMNĂTURĂ HEX (OFFSET 0):

3E

REPREZENTARE ASCII: >

Standardizare: Bioinformatics de facto global standard

Specificații tehnice

Arhitectură containerPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
CompresieUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Endianitatea octețilorASCII / UTF-8 text stream
Spații de culoareN/A (Genomic Sequence Data)
Canale și structurăNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Dimensiuni maximeUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TransparențăNone
Streaming și progresivSequential record-by-record streaming processing

Matrice de comparație tehnică: FASTA vs Competitori

Atribut tehnicFASTA (Curent)FASTQGENBANKGFF
Scoruri de calitateNiciunul (litere de secvență pură)Scoruri de calitate Phred per bazăNiciunul (anotații de caracteristici)Niciunul (coordonate de caracteristici)
Linie de antetÎncepe cu caracterul '>'Începe cu caracterul '@'Bloc LOCUS structuratColoane genomice delimitate prin tabulatori
Utilizare primarăGenomuri de referință și căutare BLASTSecvențiatoare brute cu debit mare (Illumina)Gene adnotate cuprinzătoareAnotații ale caracteristicilor genomice
Dimensiune fișier (Uman)~3 Gigabytes necomprimat~100+ Gigabytes (cu calități)Text bogat de mulți gigabiți~50 Megabytes

Moduri comune de corupție și ghid de recuperare hexazecimală

Instrumentul de bioinformatică raportează 'Caracter de secvență nevalid la linia X'.

Cauză principală: Spații albe, numere sau caractere non-IUPAC în interiorul liniilor de secvență.

Recuperare: Filtrați și curățați caracterele de secvență utilizând instrumentul de bioinformatică File2File.

Analiză de securitate și vectori de atac asupra parserului

Instrumentele de genomică analizează fișiere FASTA masive de mulți gigabiți unde pot apărea depășiri de întregi la indexarea coordonatelor secvenței.

Vectori de atac cunoscuți

  • Depășire de întregi în indexatorii de secvențe pe 32 de biți (FAI) care depășesc 2^31 perechi de baze.
  • Depășire de tampon la citirea antetelor de identificare a secvenței excesiv de lungi.
  • Refuz de serviciu prin interogări de aliniere patologice.

Cele mai bune practici de securitate:

Origini istorice și repere

2003Proiectul Genomului Uman finalizează prima secvențiere a genomului uman, publicând rezultatele în format FASTA.
1990BLAST (Basic Local Alignment Search Tool) adoptă FASTA ca format de intrare standard.
1985William Pearson și David Lipman introduc FASTA împreună cu software-ul de aliniere a secvențelor FASTP.

Avantaje cheie și beneficii

  • Standardul global indiscutabil al biologiei computaționale: utilizat de fiecare instrument genomic, secvențiator și bază de date de pe Pământ.
  • Simplitate extremă: linia 1 începe cu '>' urmată de un ID, urmată de litere genetice text simplu.
  • Capacitate pentru mai multe secvențe: un singur fișier poate conține mii de gene individuale sau genomuri virale complete.

Limitări tehnice și dezavantaje

  • Nu conține scoruri de calitate a secvențierii (Spre deosebire de FASTQ, care stochează scoruri de încredere Phred per bază).
  • Fără sintaxă de metadate standardizată pentru liniile de antet dincolo de identificatorul inițial.
  • Amprentă de stocare enormă pentru seturile de date de întreg genomul fără Gzip sau compresie genomică specializată.

Curiozități tehnice interesante

  • Întregul genom uman de 3 miliarde de perechi de baze poate fi reprezentat în format FASTA, ocupând aproximativ 3 gigabytes de stocare.
  • Cele patru litere ale ADN-ului stocate în fișierele FASTA sunt A (Adenină), C (Citozină), G (Guanină) și T (Timină).
  • Când genomul coronavirusului COVID-19 a fost secvențiat pentru prima dată în ianuarie 2020, oamenii de știință l-au distribuit la nivel global ca un fișier FASTA de 30.000 de litere.

Întrebări tehnice frecvente

Ce este un fișier FASTA?

Un fișier FASTA este un fișier text simplu utilizat în biologie pentru a stoca secvențe de ADN, ARN sau proteine folosind abrevieri dintr-o singură literă.

Care este diferența dintre FASTA și FASTQ?

FASTA stochează doar literele secvenței genetice, în timp ce FASTQ stochează atât literele, cât și scorul de calitate a preciziei secvențierii pentru fiecare bază.

Cum pot vizualiza un fișier FASTA?

Poți deschide fișiere FASTA în orice editor de text, le poți vizualiza în software de bioinformatică precum Jalview sau UGENE, sau le poți converti folosind File2File.app.