FASTA-sekvensista GenBank-tiedostoksi -muunnin
Tavallisen FASTA-sekvenssin muuntaminen GenBank-muotoon lisää raakaan geneettiseen koodiin olennaisia biologisia annotaatioita ja metatietoja.
Muotojen vertailu ja tekniset tiedot
| Määritys | FASTA | GENBANK |
|---|---|---|
| MIME-tyyppi | text/plain | text/plain |
| Tyyppi | bioinformatics sequence text | annotated nucleotide flatfile |
| Pakkaus | none (plain text) | none (plain text) |
| Standardimääritys | NCBI FASTA Specification | NCBI GenBank Flatfile Release Notes |
| Tiedostotunniste (Magic Bytes) | 3E ('>' Sequence header line) | 4C 4F 43 55 53 20 20 20 20 (LOCUS ) |
Muodon yleiskatsaus ja käyttökohteet
Genomiikan tutkijat siirtyvät usein yksinkertaisen sekvenssitekstin ja laajasti annotoitujen tietueiden välillä. FASTA-tiedosto tarjoaa kevyen säiliön, joka sisältää vain suurempi kuin -merkillä alkavan otsikkorivin ja raa'at nukleotidi- tai aminohappokirjaimet. Tämä yksinkertaisuus sopii erinomaisesti perustoisiintumistyökaluihin ja sekvenssihakuihin. Kun tutkijat kuitenkin tarvitsevat uusien genomien julkaisemista tai tiettyjen geenien ominaisuuksien tutkimista, he tarvitsevat jäsennnettyjä metatietoja. GenBank-muoto ratkaisee tämän kietomalla geneettisen sekvenssin jäykkään, moniriviseen tekstitiedostoon. Se sisältää jäsennellyt osiot lokuksien nimille, eliöiden taksonomialle, julkaisuviitteille ja ominaisuusluetteloille, jotka osoittavat tarkasti, missä kohdissa kromosomia geenit, koodaavat alueet ja promoottorit sijaitsevat. Bioinformatiikan prosessointiketjut, genomiselaimet ja lähetysportaalit, kuten NCBI GenBank, luottavat tähän runsaaseen annotaatiorakenteeseen raa'an DNA:n ymmärtämisessä. Tämän muunnoksen suorittaminen toimii siltana raa'an sekvenssilöydön ja virallisen biologisen kuvauksen välillä. Vaikka FASTA-tiedosto kertoo yksinkertaisesti, mitä kirjaimia DNA:ssa on, kohdetiedostona toimiva GenBank selittää, mitä kyseiset kirjaimet todellisuudessa tekevät elävässä solussa.
Tekniset tiedot ja koodekkien erittely
Muunnin jäsentää FASTA-tunnisterivit ja IUPAC-nukleotidisekvenssit, muotoilee sekvenssidatan numeroiduiksi 60 merkin lohkoiksi GenBankin ORIGIN-taulukon sisälle ja rakentaa tietueen standardeilla NCBI-säiliöotsakkeilla ja oletusarvoisella synteettisellä rakenteen FEATURES-lohkolla.
Käyttöjärjestelmien ja selaimien yhteensopivuus
Koska molemmat muodot ovat tavallista ASCII-tekstiä, niillä on yleinen yhteensopivuus kaikkien nykyaikaisten käyttöjärjestelmien ja laitteistoalustojen välillä. Voit avata ja muokata niitä Windows-, macOS- ja Linux-käyttöjärjestelmissä perinteisillä tekstieditoreilla tai erikoistuneilla bioinformatiikkaohjelmistoilla, kuten Geneious, SnapGene ja Artemis. Verkkoselaimet pystyvät esittämään molemmat tiedostotyypit natiivisti tekstialueilla tai JavaScript-pohjaisten sekvenssikatselimien kautta. Komentorivityökalut, kuten Biopython, EMBOSS ja NCBI BLAST, jäsennättävät nämä tiedostot saumattomasti työpöytäpäätteillä, suorituskykyisissä laskentaklusteriympäristöissä ja pilviympäristöissä.
Hyödyllistä tietoa
Varmista aina sekvenssiaakkostosi ennen muunnosta, sillä aminohappokoodien sekoittaminen nukleotidin GenBank-tietueeseen johtaa siihen, että NCBI:n lähetysjäsennys hylkää tuloksen.
Muotojen vertailu ja tekniset tiedot
Tavallinen 5 megatavun bakteerikromosomitiedosto FASTA-muodossa kasvaa noin 15 megatavun kokoiseksi, kun se laajennetaan täysin annotoiduksi GenBank-tiedostoksi lisättyjen ominaisuusluetteloiden ja kuvailevan tekstin ansiosta. Tavallisella 4G-mobiiliyhteydellä 30 megabitin sekuntinopeudella tämä 15 megatavun tiedosto siirtyy noin 4 sekunnissa. 5G-verkossa, joka toimii 150 megabitin sekuntinopeudella, siirto putoaa alle 1 sekuntiin. Nykyaikaisen kuituyhteyden kautta 1 gigabitin sekuntinopeudella tiedosto siirtyy silmänräpäyksessä sekunnin murto-osassa.
Usein kysytyt kysymykset
Miten FASTA-sekvenssi muunnetaan GenBank-tiedostoksi laatua menettämättä?
Muunnos on täysin häviötön taustalla olevalle geneettiselle sekvenssille, koska molemmat muodot tallentavat tarkalleen samat nukleotidi- tai proteiinikirjaimet. Koska FASTA-tiedostot eivät kuitenkaan sisällä biologisia annotaatioita, muunnettu GenBank-tiedosto vaatii joko automatisoidun geenien ennustamisen tai manuaalisen annotoinnin ominaisuusluetteloiden täyttämiseksi oikein.
Mikä ero on FASTA-sekvenssillä ja GenBank-tiedostolla?
FASTA-tiedosto on minimalistinen tekstimuoto, joka sisältää vain yksinkertaisen otsikkorivin ja raa'at sekvenssimerkkijonot. GenBank-tiedosto on vahvasti jäsennelty asiakirja, joka on jaettu määriteltyihin osioihin, kuten LOCUS, DEFINITION, ACCESSION, SOURCE, FEATURES ja ORIGIN, jotta sekvenssin ohella voidaan tallentaa runsaita biologisia metatietoja.