FASTA seka (.fasta)

Bioinformatics Standartinis

FASTA yra visur esantis, pamatinis bioinformatikos ir genomikos failų formatas, vaizduojantis nukleotidų sekas (DNR, RNR) ir amino rūgščių baltymų sekas naudojant visuotinius vienos raidės kodus.

Konvertuoti FASTA į GENBANK

Nemokamas FASTA į GENBANK konverteris naršyklėje. Konvertuokite failus akimirksniu savo įrenginyje.

Tikrinti ir metaduomenys

Operacinės sistemos ir failų analizatoriai atpažįsta FASTA failus tikrindami pradinę dvejetainę baitų seką:

Pasirinkite arba nuvilkite failus čia

100% privatus konvertavimas naršyklėje - failai niekada nepalieka jūsų įrenginio

arba įklijuokite Ctrl+V
Nulinio tinklo perdavimo privatumo garantija: 0 baitų įkelta į išorinius serverius. Visas apdorojimas vyko vietoje, jūsų naršyklės smėlio dėžėje (sandbox).

Baitų lygio antraštės parašas (magiškieji baitai)

Operacinės sistemos ir failų analizatoriai atpažįsta FASTA failus tikrindami pradinę dvejetainę baitų seką:

ŠEŠIOLIKTAINIS PARAŠAS (POSLINKIS 0):

3E

ASCII ATVAIZDAVIMAS: >

Standartizacija: Bioinformatics de facto global standard

Techninės specifikacijos

Konteinerio architektūraPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
GlaudinimasUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Baitų seka (Endianness)ASCII / UTF-8 text stream
Spalvų erdvėsN/A (Genomic Sequence Data)
Kanalai ir struktūraNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maksimalūs matmenysUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
SkaidrumasNone
Srautas ir progresyvusis įkėlimasSequential record-by-record streaming processing

Techninė palyginimo matrica: FASTA vs konkurentai

Techninis atributasFASTA (Dabartinis)FASTQGENBANKGFF
Kokybės balaiNėra (grynos sekos raidės)Kiekvienos bazės „Phred" kokybės balaiNėra (požymių anotacijos)Nėra (požymių koordinačių)
Antraštės eilutėPrasideda simboliu „>"Prasideda simboliu „@"Struktūrizuotas LOCUS blokasAtskyrimo kableliais genominiai stulpeliai
Pirminis naudojimasEtaloniniai genomai ir BLAST paieškaNeapdoroti didelio pralaidumo sekvenavimo įrenginiai („Illumina")Išsamūs anotuoti genaiGenominių požymių anotacijos
Failo dydis (žmogaus)~3 gigabaitai nesuspausti~100+ gigabaitų (su kokybėmis)Kelių gigabaitų turtingas tekstas~50 megabaitų

Dažni sugadinimo režimai ir šešioliktainio atkūrimo vadovas

Bioinformatikos įrankis praneša: „Netinkamas sekos simbolis X eilutėje".

Pirminė priežastis: Tarpai, skaičiai arba ne IUPAC simboliai sekos eilutėse.

Atkūrimas: Filtruokite ir išvalykite sekos simbolius naudodami „File2File Bioinformatics Tool" įrankį.

Saugumo analizė ir analizatoriaus atakos vektoriai

Genomikos įrankiai analizuoja masinius kelių gigabaitų FASTA failus, kuriuose indeksuojant sekos koordinates gali kilti sveikųjų skaičių perpildymas.

Žinomi atakos vektoriai

  • Sveikųjų skaičių perpildymas 32 bitų sekų indeksavimo priemonėse (FAI), viršijančiose 2^31 bazinių porų.
  • Buferio perkrova skaitant per ilgas sekos identifikatoriaus antraštes.
  • Paslaugų trikdymas (DoS) naudojant patologines sulyginimo užklausas.

Geriausia apsaugos praktika:

Istorinė kilmė ir svarbiausi etapai

2003Žmogaus geno projektas užbaigia pirmąjį žmogaus genomo sekvenavimą, paskelbdamas rezultatus FASTA formatu.
1990BLAST („Basic Local Alignment Search Tool") priima FASTA kaip savo standartinį įvesties formatą.
1985William Pearson ir David Lipman pristato FASTA kartu su „FASTP" sekų sulyginimo programine įranga.

Pagrindiniai privalumai

  • Nesiginčijamas pasaulinis skaitmeninės biologijos standartas: naudojamas kiekvieno genominio įrankio, sekvenavimo įrenginio ir duomenų bazės Žemėje.
  • Ypatingas paprastumas: 1 eilutė prasideda „>", po kurios seka ID, o po jo - paprasto teksto genetinės raidės.
  • Kelių sekų talpa: viename faile gali būti tūkstančiai atskirų genų arba pilnų virusinių genomų.

Techniniai apribojimai ir trūkumai

  • Neturi sekvenavimo kokybės balų (skirtingai nei FASTQ, kuri saugo kiekvienos bazės „Phred" patikimumo balus).
  • Nėra standartizuotos metaduomenų sintaksės antraštės eilutėms, išskyrus pradinį identifikatorių.
  • Milžiniška saugojimo vieta viso genomo duomenų rinkiniams be „Gzip" ar specializuoto genominio suspaudimo.

Įdomūs techniniai faktai

  • Visas 3 milijardų bazinių porų žmogaus genomas gali būti pavaizduotas FASTA formatu, užimantis maždaug 3 gigabaitus vietos saugykloje.
  • Keturios DNR raidės, saugomos FASTA failuose, yra A (adeninas), C (citozinas), G (guaninas) ir T (timinas).
  • Kai COVID-19 koronaviruso genomas buvo pirmą kartą sekvenuotas 2020 m. sausio mėn., mokslininkai juo pasidalijo visame pasaulyje kaip 30 000 raidžių FASTA failu.

Dažniausiai užduodami techniniai klausimai

Kas yra FASTA failas?

FASTA failas yra paprastas tekstinis failas, naudojamas biologijoje DNR, RNR arba baltymų sekoms saugoti naudojant vienos raidės sutrumpinimus.

Kuo skiriasi FASTA ir FASTQ?

FASTA saugo tik genetinių sekų raides, o FASTQ saugo tiek raides, tiek kiekvienos bazės sekoskaitos tikslumo kokybės įvertinimą.

Kaip galiu peržiūrėti FASTA failą?

FASTA failus galite atidaryti bet kurioje tekstinėje rengyklėje, peržiūrėti juos bioinformatikos programinėje įrangoje, pavyzdžiui, „Jalview“ arba „UGENE“, arba konvertuoti naudojant File2File.app.