FASTA-sekvensista GenBank-tiedostoksi -muunnin
Tavallisen FASTA-sekvenssin muuntaminen GenBank-muotoon lisää raakaan geneettiseen koodiin olennaisia biologisia annotaatioita ja metatietoja.
Muotojen vertailu ja tekniset tiedot
| Määritys | FASTA | GENBANK |
|---|---|---|
| MIME-tyyppi | text/plain | text/plain |
| Tyyppi | bioinformatics sequence text | annotated nucleotide flatfile |
| Pakkaus | none (plain text) | none (plain text) |
| Standardimääritys | NCBI FASTA Specification | NCBI GenBank Flatfile Release Notes |
| Tiedostotunniste (Magic Bytes) | 3E ('>' Sequence header line) | 4C 4F 43 55 53 20 20 20 20 (LOCUS ) |
Muodon yleiskatsaus ja käyttökohteet
Genomiikan tutkijat siirtyvät usein yksinkertaisen sekvenssitekstin ja laajasti annotoitujen tietueiden välillä. FASTA-tiedosto tarjoaa kevyen säiliön, joka sisältää vain suurempi kuin -merkillä alkavan otsikkorivin ja raa'at nukleotidi- tai aminohappokirjaimet. Tämä yksinkertaisuus sopii erinomaisesti perustoisiintumistyökaluihin ja sekvenssihakuihin. Kun tutkijat kuitenkin tarvitsevat uusien genomien julkaisemista tai tiettyjen geenien ominaisuuksien tutkimista, he tarvitsevat jäsennnettyjä metatietoja. GenBank-muoto ratkaisee tämän kietomalla geneettisen sekvenssin jäykkään, moniriviseen tekstitiedostoon. Se sisältää jäsennellyt osiot lokuksien nimille, eliöiden taksonomialle, julkaisuviitteille ja ominaisuusluetteloille, jotka osoittavat tarkasti, missä kohdissa kromosomia geenit, koodaavat alueet ja promoottorit sijaitsevat. Bioinformatiikan prosessointiketjut, genomiselaimet ja lähetysportaalit, kuten NCBI GenBank, luottavat tähän runsaaseen annotaatiorakenteeseen raa'an DNA:n ymmärtämisessä. Tämän muunnoksen suorittaminen toimii siltana raa'an sekvenssilöydön ja virallisen biologisen kuvauksen välillä. Vaikka FASTA-tiedosto kertoo yksinkertaisesti, mitä kirjaimia DNA:ssa on, kohdetiedostona toimiva GenBank selittää, mitä kyseiset kirjaimet todellisuudessa tekevät elävässä solussa.
Tekniset tiedot ja koodekkien erittely
Molemmat muodot käyttävät pakkaamatonta pelkkää tekstiä MIME-tyypillä text/plain, mikä tarkoittaa, että kumpikaan muoto ei perustu binaarisiin taikamerkkiallekirjoitukse otsikoihin tai suljettuihin otsikoihin. Sen sijaan ne ovat riippuvaisia rakenteellisista jäsennyssäännöistä. FASTA-tiedostot käyttävät ASCII-tekstiä, joka alkaa '>' -merkillä otsikkoa varten, sekä tavallisia yksikirjaimisia koodeja nukleotideille (A, C, G, T, N). GenBank-tiedostot käyttävät tiukkaa rivipohjaista arkkitehtuuria, joka alkaa avainsanalla 'LOCUS' ja päättyy '//'-lopetusmerkkiin. Muunnostyökalujen on luettava raakamerkkijonotiedot FASTA-syötteestä, kartoitettava sekvenssi tavalliseen GenBank ORIGIN -lohkoon ja syötettävä käyttäjän toimittamat tai ennustetut annotaatiolohkot FEATURES-osioon. Koska molemmat tiedostot ovat pelkkää tekstiä, muunnos on täysin häviötön ensisijaisen sekvenssidatan osalta, vaikka annotaatiot on lisättävä manuaalisesti tai laskennallisesti ennustettuna, koska FASTAlta puuttuu rakenteellinen metatieto.
Käyttöjärjestelmien ja selaimien yhteensopivuus
Koska molemmat muodot ovat tavallista ASCII-tekstiä, niillä on yleinen yhteensopivuus kaikkien nykyaikaisten käyttöjärjestelmien ja laitteistoalustojen välillä. Voit avata ja muokata niitä Windows-, macOS- ja Linux-käyttöjärjestelmissä perinteisillä tekstieditoreilla tai erikoistuneilla bioinformatiikkaohjelmistoilla, kuten Geneious, SnapGene ja Artemis. Verkkoselaimet pystyvät esittämään molemmat tiedostotyypit natiivisti tekstialueilla tai JavaScript-pohjaisten sekvenssikatselimien kautta. Komentorivityökalut, kuten Biopython, EMBOSS ja NCBI BLAST, jäsennättävät nämä tiedostot saumattomasti työpöytäpäätteillä, suorituskykyisissä laskentaklusteriympäristöissä ja pilviympäristöissä.
💡 Hyödyllistä tietoa
Varmista aina sekvenssiaakkostosi ennen muunnosta, sillä aminohappokoodien sekoittaminen nukleotidin GenBank-tietueeseen johtaa siihen, että NCBI:n lähetysjäsennys hylkää tuloksen.
Muotojen vertailu ja tekniset tiedot
Tavallinen 5 megatavun bakteerikromosomitiedosto FASTA-muodossa kasvaa noin 15 megatavun kokoiseksi, kun se laajennetaan täysin annotoiduksi GenBank-tiedostoksi lisättyjen ominaisuusluetteloiden ja kuvailevan tekstin ansiosta. Tavallisella 4G-mobiiliyhteydellä 30 megabitin sekuntinopeudella tämä 15 megatavun tiedosto siirtyy noin 4 sekunnissa. 5G-verkossa, joka toimii 150 megabitin sekuntinopeudella, siirto putoaa alle 1 sekuntiin. Nykyaikaisen kuituyhteyden kautta 1 gigabitin sekuntinopeudella tiedosto siirtyy silmänräpäyksessä sekunnin murto-osassa.
Usein kysytyt kysymykset
Miten FASTA-sekvenssi muunnetaan GenBank-tiedostoksi laatua menettämättä?
Muunnos on täysin häviötön taustalla olevalle geneettiselle sekvenssille, koska molemmat muodot tallentavat tarkalleen samat nukleotidi- tai proteiinikirjaimet. Koska FASTA-tiedostot eivät kuitenkaan sisällä biologisia annotaatioita, muunnettu GenBank-tiedosto vaatii joko automatisoidun geenien ennustamisen tai manuaalisen annotoinnin ominaisuusluetteloiden täyttämiseksi oikein.
Mikä ero on FASTA-sekvenssillä ja GenBank-tiedostolla?
FASTA-tiedosto on minimalistinen tekstimuoto, joka sisältää vain yksinkertaisen otsikkorivin ja raa'at sekvenssimerkkijonot. GenBank-tiedosto on vahvasti jäsennelty asiakirja, joka on jaettu määriteltyihin osioihin, kuten LOCUS, DEFINITION, ACCESSION, SOURCE, FEATURES ja ORIGIN, jotta sekvenssin ohella voidaan tallentaa runsaita biologisia metatietoja.