FASTA seka (.fasta)
Bioinformatics StandartinisFASTA yra visur esantis, pamatinis bioinformatikos ir genomikos failų formatas, vaizduojantis nukleotidų sekas (DNR, RNR) ir amino rūgščių baltymų sekas naudojant visuotinius vienos raidės kodus.
Konvertuoti FASTA į GENBANK
Nemokamas FASTA į GENBANK konverteris naršyklėje. Konvertuokite failus akimirksniu savo įrenginyje.
Tikrinti ir metaduomenys
Operacinės sistemos ir failų analizatoriai atpažįsta FASTA failus tikrindami pradinę dvejetainę baitų seką:
Baitų lygio antraštės parašas (magiškieji baitai)
Operacinės sistemos ir failų analizatoriai atpažįsta FASTA failus tikrindami pradinę dvejetainę baitų seką:
ŠEŠIOLIKTAINIS PARAŠAS (POSLINKIS 0):
3EASCII ATVAIZDAVIMAS: >
Standartizacija: Bioinformatics de facto global standard
Techninės specifikacijos
| Konteinerio architektūra | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Glaudinimas | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Baitų seka (Endianness) | ASCII / UTF-8 text stream |
| Spalvų erdvės | N/A (Genomic Sequence Data) |
| Kanalai ir struktūra | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maksimalūs matmenys | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Skaidrumas | None |
| Srautas ir progresyvusis įkėlimas | Sequential record-by-record streaming processing |
Techninė palyginimo matrica: FASTA vs konkurentai
| Techninis atributas | FASTA (Dabartinis) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kokybės balai | Nėra (grynos sekos raidės) | Kiekvienos bazės „Phred" kokybės balai | Nėra (požymių anotacijos) | Nėra (požymių koordinačių) |
| Antraštės eilutė | Prasideda simboliu „>" | Prasideda simboliu „@" | Struktūrizuotas LOCUS blokas | Atskyrimo kableliais genominiai stulpeliai |
| Pirminis naudojimas | Etaloniniai genomai ir BLAST paieška | Neapdoroti didelio pralaidumo sekvenavimo įrenginiai („Illumina") | Išsamūs anotuoti genai | Genominių požymių anotacijos |
| Failo dydis (žmogaus) | ~3 gigabaitai nesuspausti | ~100+ gigabaitų (su kokybėmis) | Kelių gigabaitų turtingas tekstas | ~50 megabaitų |
Dažni sugadinimo režimai ir šešioliktainio atkūrimo vadovas
Bioinformatikos įrankis praneša: „Netinkamas sekos simbolis X eilutėje".
Pirminė priežastis: Tarpai, skaičiai arba ne IUPAC simboliai sekos eilutėse.
Atkūrimas: Filtruokite ir išvalykite sekos simbolius naudodami „File2File Bioinformatics Tool" įrankį.
Saugumo analizė ir analizatoriaus atakos vektoriai
Genomikos įrankiai analizuoja masinius kelių gigabaitų FASTA failus, kuriuose indeksuojant sekos koordinates gali kilti sveikųjų skaičių perpildymas.
Žinomi atakos vektoriai
- Sveikųjų skaičių perpildymas 32 bitų sekų indeksavimo priemonėse (FAI), viršijančiose 2^31 bazinių porų.
- Buferio perkrova skaitant per ilgas sekos identifikatoriaus antraštes.
- Paslaugų trikdymas (DoS) naudojant patologines sulyginimo užklausas.
Geriausia apsaugos praktika:
Istorinė kilmė ir svarbiausi etapai
Pagrindiniai privalumai
- Nesiginčijamas pasaulinis skaitmeninės biologijos standartas: naudojamas kiekvieno genominio įrankio, sekvenavimo įrenginio ir duomenų bazės Žemėje.
- Ypatingas paprastumas: 1 eilutė prasideda „>", po kurios seka ID, o po jo - paprasto teksto genetinės raidės.
- Kelių sekų talpa: viename faile gali būti tūkstančiai atskirų genų arba pilnų virusinių genomų.
Techniniai apribojimai ir trūkumai
- Neturi sekvenavimo kokybės balų (skirtingai nei FASTQ, kuri saugo kiekvienos bazės „Phred" patikimumo balus).
- Nėra standartizuotos metaduomenų sintaksės antraštės eilutėms, išskyrus pradinį identifikatorių.
- Milžiniška saugojimo vieta viso genomo duomenų rinkiniams be „Gzip" ar specializuoto genominio suspaudimo.
Įdomūs techniniai faktai
- Visas 3 milijardų bazinių porų žmogaus genomas gali būti pavaizduotas FASTA formatu, užimantis maždaug 3 gigabaitus vietos saugykloje.
- Keturios DNR raidės, saugomos FASTA failuose, yra A (adeninas), C (citozinas), G (guaninas) ir T (timinas).
- Kai COVID-19 koronaviruso genomas buvo pirmą kartą sekvenuotas 2020 m. sausio mėn., mokslininkai juo pasidalijo visame pasaulyje kaip 30 000 raidžių FASTA failu.
Dažniausiai užduodami techniniai klausimai
Kas yra FASTA failas?
FASTA failas yra paprastas tekstinis failas, naudojamas biologijoje DNR, RNR arba baltymų sekoms saugoti naudojant vienos raidės sutrumpinimus.
Kuo skiriasi FASTA ir FASTQ?
FASTA saugo tik genetinių sekų raides, o FASTQ saugo tiek raides, tiek kiekvienos bazės sekoskaitos tikslumo kokybės įvertinimą.
Kaip galiu peržiūrėti FASTA failą?
FASTA failus galite atidaryti bet kurioje tekstinėje rengyklėje, peržiūrėti juos bioinformatikos programinėje įrangoje, pavyzdžiui, „Jalview“ arba „UGENE“, arba konvertuoti naudojant File2File.app.
Susijusios FASTA konvertavimo poros
Paprastos FASTA sekvencijos konvertavimas į GenBank formatą prideda esminius biologinius anotacijų duomenis ir metaduomenis prie žalio genetinio kodo.
GenBank formato failo konvertavimas į FASTA sekvenciją pašalina anotacijų metaduomenis, paliekant tik žalias nukleotidų arba aminorūgščių sekvencijas, reikalingas greitai bioinformatikos analizei.