FASTA-sekvenssi (.fasta)

Bioinformatics Standardi

FASTA on bioinformatiikan ja genomiikan kaikkialla läsnä oleva perusta tiedostomuotona, joka esittää nukleotidisekvenssejä (DNA, RNA) ja aminohappoproteiinisekvenssejä käyttämällä yleismaailmallisia yksikirjaimisia koodeja.

Muunna tiedostot muodosta FASTA muotoon GENBANK

Ilmainen selaimen sisäinen FASTA - GENBANK-muunnin. Muunna tiedostoja välittömästi laitteellasi.

Tarkastele ja metatiedot

Käyttöjärjestelmät ja tiedostoanalyysaattorit tunnistavat FASTA-tiedostot tarkistamalla tiedoston alun binäärisarjan:

Valitse tai pudota tiedostot tähän

100 % yksityinen selaimen sisäinen muunnos - tiedostot eivät poistu laitteeltasi

tai liitä Ctrl+V
Tietosuojatakuu: 0 % verkkosiirtoa 0 tavua ladattu ulkoisille palvelimille. Kaikki käsittely tapahtui paikallisesti selaimen hiekkalaatikossa.

Tavutason otsikon allekirjoitus (Magic Bytes)

Käyttöjärjestelmät ja tiedostoanalyysaattorit tunnistavat FASTA-tiedostot tarkistamalla tiedoston alun binäärisarjan:

HEX-ALLEKIRJOITUS (OFFSET 0):

3E

ASCII-ESITYSTAPA: >

Standardointi: Bioinformatics de facto global standard

Tekniset tiedot

SäiliöarkkitehtuuriPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
PakkausUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Tavujärjestys (Endianness)ASCII / UTF-8 text stream
VäriavaruudetN/A (Genomic Sequence Data)
Kanavat ja rakenneNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Suurimmat mitatUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
LäpinäkyvyysNone
Suoratoisto ja progressiivinen latausSequential record-by-record streaming processing

Tekninen vertailumatriisi: FASTA vs. kilpailijat

Tekninen attribuuttiFASTA (Nykyinen)FASTQGENBANKGFF
LaatupisteetEi mitään (puhtaat sekvenssikirjaimet)Emäskohtaiset Phred-laatupisteetEi mitään (ominaisuuksien huomautukset)Ei mitään (ominaisuuksien koordinaatit)
OtsakeriviAlkaa merkillä '>'Alkaa merkillä '@'Rakenteinen LOCUS-lohkoSarakkeittain sarkaimilla erotellut genomisarakkeet
Ensisijainen käyttötarkoitusVertailugenomit ja BLAST-hakuRaaoat suuren suorituskyvyn sekvensoijat (Illumina)Kattavat huomautetut geenitGenomisten ominaisuuksien huomautukset
Tiedostokoko (ihminen)~3 gigatavua pakkaamattomana~100+ gigatavua (laatujen kanssa)Monigigatavuinen rikas teksti~50 megatavua

Yleiset korruptiotilat ja heksatietojehdotusopas

Bioinformatiikkatyökalu ilmoittaa 'Virheellinen sekvenssimerkki rivillä X'.

Perussyy: Tyhjemerkkejä, numeroita tai muita kuin IUPAC-merkkejä sekvenssirivien sisällä.

Korjaus: Suodata ja puhdista sekvenssimerkit File2File Bioinformatics Tool -työkalulla.

Turvallisuusanalyysi ja jäsenninhyökkäysvektorit

Genomiikkatyökalut jäsennöivät valtavia monigigatavuisia FASTA-tiedostoja, joissa voi esiintyä kokonaisluvun ylivuotoja indeksoitaessa sekvenssin koordinaatteja.

Tunnetut hyökkäysvektorit

  • Kokonaisluvun ylivuoto 32-bittisissä sekvenssi-indeksoijissa (FAI), kun ylitetään 2^31 emäsparia.
  • Puskurin ylivuoto luettaessa liian pitkiä sekvenssin tunnisteotsikoita.
  • Palvelunestohyökkäys epänormaalien kohdistuskyselyjen kautta.

Parhaat puolustuskäytännöt:

Historia ja virstanpylväät

2003Ihmisen genomin hanke (Human Genome Project) saa valmiiksi ihmisen genomin ensimmäisen sekvensoinnin ja julkaisee tulokset FASTA-muodossa.
1990BLAST (Basic Local Alignment Search Tool) ottaa FASTA-muodon käyttöön vakiosisääntulomuotonaan.
1985William Pearson ja David Lipman esittelevät FASTAn FASTP-sekvenssien kohdistusohjelmiston yhteydessä.

Tärkeimmät edut

  • Laskennallisen biologian kiistaton maailmanlaajuinen standardi: käytössä jokaisessa genomityökalussa, sekvensoijassa ja tietokannassa maapallolla.
  • Äärimmäinen yksinkertaisuus: rivi 1 alkaa merkillä '>' ja sitä seuraa tunniste, jota seuraavat pelkkää tekstiä olevat geneettiset kirjaimet.
  • Monen sekvenssin kapasiteetti: yksi ainoa tiedosto voi sisältää tuhansia yksittäisiä geenejä tai täydellisiä viruksen genomeja.

Tekniset rajoitukset

  • Ei sisällä sekvensoinnin laatupisteitä (toisin kuin FASTQ, joka tallentaa emäskohtaiset Phred-luottamuslukemat).
  • Ei standardoitua metatietosynaksia otsakerveille alkuperäisen tunnisteen lisäksi.
  • Valtava tallennustilan tarve kokogenomiaineistoille ilman Gzip-pakkausta tai erikoistunutta genomipakkausta.

Mielenkiintoisia teknisiä faktoja

  • Koko ihmisen 3 miljardin emäsparin genomi voidaan esittää FASTA-muodossa, mikä vie noin 3 gigatavua tallennustilaa.
  • DNA:n neljä kirjainta FASTA-tiedostoissa ovat A (adeniini), C (sytosiini), G (guaniini) ja T (tymiini).
  • Kun COVID-19-koronaviruksen genomi sekvensoitiin ensimmäisen kerran tammikuussa 2020, tutkijat jakoivat sen maailmanlaajuisesti 30 000 kirjaimen FASTA-tiedostona.

Usein kysytyt tekniset kysymykset

Mikä on FASTA-tiedosto?

FASTA-tiedosto on pelkkä tekstitiedosto, jota käytetään biologiassa DNA-, RNA- tai proteiinisekvenssien tallentamiseen yksikirjaimisia lyhenteitä käyttäen.

Mikä ero on FASTA- ja FASTQ-tiedostojen välillä?

FASTA tallentaa vain geneettiset sekvenssikirjaimet, kun taas FASTQ tallentaa sekä kirjaimet että sekvensoinnin tarkkuuden laatupisteet jokaiselle emäkselle.

Miten voin tarkastella FASTA-tiedostoa?

Voit avata FASTA-tiedostoja missä tahansa tekstieditorissa, tarkastella niitä bioinformatiikkaohjelmistoissa kuten Jalview tai UGENE, tai muuntaa ne File2File.app-palvelun avulla.