Secvență FASTA (.fasta)
Bioinformatics StandardFASTA este formatul de fișier omniprezent și fundamental al bioinformaticii și genomicii, reprezentând secvențe de nucleotide (ADN, ARN) și secvențe de aminoacizi proteici folosind coduri universale cu o singură literă.
Convertește din FASTA în GENBANK
Convertor gratuit din FASTA în GENBANK direct în browser. Convertește fișiere instantaneu pe dispozitivul tău.
Inspectează și Metadate
Sistemele de operare și analizatoarele de fișiere identifică fișierele FASTA prin inspectarea secvenței binare inițiale:
Semnătura antetului la nivel de octet (Magic Bytes)
Sistemele de operare și analizatoarele de fișiere identifică fișierele FASTA prin inspectarea secvenței binare inițiale:
SEMNĂTURĂ HEX (OFFSET 0):
3EREPREZENTARE ASCII: >
Standardizare: Bioinformatics de facto global standard
Specificații tehnice
| Arhitectură container | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Compresie | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Endianitatea octeților | ASCII / UTF-8 text stream |
| Spații de culoare | N/A (Genomic Sequence Data) |
| Canale și structură | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Dimensiuni maxime | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Transparență | None |
| Streaming și progresiv | Sequential record-by-record streaming processing |
Matrice de comparație tehnică: FASTA vs Competitori
| Atribut tehnic | FASTA (Curent) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Scoruri de calitate | Niciunul (litere de secvență pură) | Scoruri de calitate Phred per bază | Niciunul (anotații de caracteristici) | Niciunul (coordonate de caracteristici) |
| Linie de antet | Începe cu caracterul '>' | Începe cu caracterul '@' | Bloc LOCUS structurat | Coloane genomice delimitate prin tabulatori |
| Utilizare primară | Genomuri de referință și căutare BLAST | Secvențiatoare brute cu debit mare (Illumina) | Gene adnotate cuprinzătoare | Anotații ale caracteristicilor genomice |
| Dimensiune fișier (Uman) | ~3 Gigabytes necomprimat | ~100+ Gigabytes (cu calități) | Text bogat de mulți gigabiți | ~50 Megabytes |
Moduri comune de corupție și ghid de recuperare hexazecimală
Instrumentul de bioinformatică raportează 'Caracter de secvență nevalid la linia X'.
Cauză principală: Spații albe, numere sau caractere non-IUPAC în interiorul liniilor de secvență.
Recuperare: Filtrați și curățați caracterele de secvență utilizând instrumentul de bioinformatică File2File.
Analiză de securitate și vectori de atac asupra parserului
Instrumentele de genomică analizează fișiere FASTA masive de mulți gigabiți unde pot apărea depășiri de întregi la indexarea coordonatelor secvenței.
Vectori de atac cunoscuți
- Depășire de întregi în indexatorii de secvențe pe 32 de biți (FAI) care depășesc 2^31 perechi de baze.
- Depășire de tampon la citirea antetelor de identificare a secvenței excesiv de lungi.
- Refuz de serviciu prin interogări de aliniere patologice.
Cele mai bune practici de securitate:
Origini istorice și repere
Avantaje cheie și beneficii
- Standardul global indiscutabil al biologiei computaționale: utilizat de fiecare instrument genomic, secvențiator și bază de date de pe Pământ.
- Simplitate extremă: linia 1 începe cu '>' urmată de un ID, urmată de litere genetice text simplu.
- Capacitate pentru mai multe secvențe: un singur fișier poate conține mii de gene individuale sau genomuri virale complete.
Limitări tehnice și dezavantaje
- Nu conține scoruri de calitate a secvențierii (Spre deosebire de FASTQ, care stochează scoruri de încredere Phred per bază).
- Fără sintaxă de metadate standardizată pentru liniile de antet dincolo de identificatorul inițial.
- Amprentă de stocare enormă pentru seturile de date de întreg genomul fără Gzip sau compresie genomică specializată.
Curiozități tehnice interesante
- Întregul genom uman de 3 miliarde de perechi de baze poate fi reprezentat în format FASTA, ocupând aproximativ 3 gigabytes de stocare.
- Cele patru litere ale ADN-ului stocate în fișierele FASTA sunt A (Adenină), C (Citozină), G (Guanină) și T (Timină).
- Când genomul coronavirusului COVID-19 a fost secvențiat pentru prima dată în ianuarie 2020, oamenii de știință l-au distribuit la nivel global ca un fișier FASTA de 30.000 de litere.
Întrebări tehnice frecvente
Ce este un fișier FASTA?
Un fișier FASTA este un fișier text simplu utilizat în biologie pentru a stoca secvențe de ADN, ARN sau proteine folosind abrevieri dintr-o singură literă.
Care este diferența dintre FASTA și FASTQ?
FASTA stochează doar literele secvenței genetice, în timp ce FASTQ stochează atât literele, cât și scorul de calitate a preciziei secvențierii pentru fiecare bază.
Cum pot vizualiza un fișier FASTA?
Poți deschide fișiere FASTA în orice editor de text, le poți vizualiza în software de bioinformatică precum Jalview sau UGENE, sau le poți converti folosind File2File.app.
Perechi de conversie FASTA conexe
Conversia unei secvențe FASTA simple într-un fișier plan GenBank adaugă adnotări biologice esențiale și metadate codului genetic brut.
Conversia unui fișier plan GenBank într-o secvență FASTA elimină metadatele de adnotare, lăsând doar secvențele brute de nucleotide sau aminoacizi necesare pentru o analiză bioinformatică rapidă.