FASTA sekvencos į GenBank failo keitiklį

Paprastos FASTA sekvencijos konvertavimas į GenBank formatą prideda esminius biologinius anotacijų duomenis ir metaduomenis prie žalio genetinio kodo.

Pasirinkite arba tempkite failus

Pasirinkite arba nuvilkite failus čia

100% privatus konvertavimas naršyklėje - failai niekada nepalieka jūsų įrenginio

arba įklijuokite Ctrl+V
Nulinio tinklo perdavimo privatumo garantija: 0 baitų įkelta į išorinius serverius. Visas apdorojimas vyko vietoje, jūsų naršyklės smėlio dėžėje (sandbox).

Formatų palyginimas ir techninės specifikacijos

SpecifikacijaFASTAGENBANK
MIME tipastext/plaintext/plain
Tipasbioinformatics sequence textannotated nucleotide flatfile
Glaudinimasnone (plain text)none (plain text)
Standartinė specifikacijaNCBI FASTA SpecificationNCBI GenBank Flatfile Release Notes
Maginės baitų antraštės (Magic Bytes)3E ('>' Sequence header line)4C 4F 43 55 53 20 20 20 20 (LOCUS )

Formato apžvalga ir taikymas

Genomikos tyrinėtojai dažnai keičiasi paprastais sekvencijų tekstais ir gausiai anotuotais įrašais. FASTA failas yra lengvas konteineris, kuriame yra tik antraštės eilutė, prasidedanti didesnio už simboliu, ir žalios nukleotidų arba aminorūgščių raidės. Šis paprastumas yra naudingas baziniams palyginimo įrankiams ir sekvencijų paieškoms. Tačiau kai mokslininkams reikia paskelbti naujus genus arba tyrinėti konkrečias genų ypatybes, jiems reikia struktūrizuotų metaduomenų. GenBank formato failas išsprendžia šią problemą apvyniodamas genetinę sekvenciją į griežtą, kelių eilučių tekstinį dokumentą. Jame yra struktūrizuoti skyriai lokusų pavadinimams, organizmų taksonomijai, publikacijų nuorodoms ir elementų lentelėms, kurios tiksliai nurodo, kur chromosomoje yra genai, koduojančios sritys ir promotoriai. Bioinformatikos procesai, genomų naršyklės ir pateikimo portalai, tokie kaip NCBI GenBank, remiasi šia turtinga anotacijų struktūra, kad suprastų žalią DNR. Šis konvertavimas sujungia žaliojo sekvencijos atradimo ir oficialaus biologinio aprašymo sritis. Kol FASTA failas tiesiog nurodo, kokios raidės yra DNR, tikslinis GenBank failas paaiškina, ką šios raidės iš tikrųjų veikia gyvoje ląstelėje.

Techninės specifikacijos ir kodekų apžvalga

Abiejuose formatuose naudojamas nesuspaustas paprastas tekstas su MIME tipo reikšme text/plain, o tai reiškia, kad nei vienas formatas nesiremia dvejetainiais magiškojo baito parašais ar nuosavybinėmis antraštėmis. Vietoj to jie priklauso nuo struktūrinių analizės taisyklių. FASTA failai naudoja ASCII tekstą, prasidedantį simboliu '>' antraštei ir standartiniams vienos raidės kodams nukleotidams (A, C, G, T, N). GenBank formato failai naudoja griežtą eilutėmis pagrįstą architektūrą, prasidedančią raktiniu žodžiu „LOCUS" ir besibaigiančią „//" žyme. Konvertavimo įrankiai turi nuskaityti žaliojo tipo eilutės duomenis iš FASTA įvesties, susieti sekvenciją į standartinį GenBank ORIGIN bloką ir įterpti vartotojo pateiktus arba prognozuotus anotacijų blokus į FEATURES skyrių. Kadangi abu failai yra paprastas tekstas, konvertavimas yra visiškai be nuostolių pirminių sekvencijų duomenims, nors anotacijos turi būti rankiniu būdu pridedamos arba apskaičiuojamos kompiuteriu, nes FASTA neturi struktūrinių metaduomenų.

OS ir naršyklės suderinamumas

Kadangi abu formatai yra standartinis ASCII tekstas, jie pasižymi universaliu suderinamumu visose šiuolaikinėse operacinėse sistemose ir aparatūros platformose. Juos galite atidaryti ir redaguoti „Windows", „macOS" ir „Linux" naudodami pagrindines teksto rengykles arba specializuotus bioinformatikos rinkinius, tokius kaip „Geneious", „SnapGene" ir „Artemis". Žiniatinklio naršyklės gali natūraliai atvaizduoti abu failų tipus teksto laukuose arba per „JavaScript" pagrįstas sekvencijų žiūrykles. Komandų eilutės įrankiai, tokie kaip „Biopython", „EMBOSS" ir „NCBI BLAST", sklandžiai skaito šiuos failus stalinių kompiuterių terminaluose, didelio našumo skaičiavimo klasteriuose ir debesų kompiuterijos aplinkose.

💡 Naudinga informacija

Prieš konvertuodami visada patikrinkite savo sekvencijos alfabetą, nes aminorūgščių kodų įmaišymas į nukleotidų GenBank įrašą privers NCBI pateikimo analizatorius atmesti išvestį.

Formatų palyginimas ir techninės specifikacijos

Tipinis 5 megabaitų bakterijos chromosomos failas FASTA formatu išauga maždaug iki 15 megabaitų, kai jis išplečiamas į visiškai anotuotą GenBank failą dėl pridėtų elementų lentelių ir aprašomojo teksto. Naudojant standartinį 4G mobiliojo ryšio 30 megabitų per sekundę greitį, šis 15 megabaitų failas perkeliamas per maždaug 4 sekundes. 5G tinkluje, veikiančiame 150 megabitų per sekundę greičiu, perkėlimas sumažėja iki mažiau nei 1 sekundės. Naudojant šiuolaikinį šviesolaidinį ryšį, kurio greitis yra 1 gigabitas per sekundę, failas perkeliamas akimirksniu per sekundės dalį.

Dažnai užduodami klausimai

Kaip konvertuoti FASTA sekvenciją į GenBank failą neprarandant kokybės?

Konvertavimas yra visiškai be nuostolių pagrindinei genetinei sekvencijai, nes abiejuose formatuose saugomos lygiai tokios pačios nukleotidų arba baltymų raidės. Tačiau kadangi FASTA failuose nėra biologinių anotacijų, bet kuriam konvertuotam GenBank failui reikės arba automatinių genų prognozių, arba rankinio anotavimo, kad elementų lentelės būtų užpildytos teisingai.

Kuo skiriasi FASTA sekvencija ir GenBank failas?

FASTA failas yra minimalus teksto formatas, kuriame yra tik paprasta antraštės eilutė ir žalios sekvencijos eilutės. GenBank failas yra gausiai struktūrizuotas dokumentas, padalintas į apibrėžtus skyrius, tokius kaip LOCUS, DEFINITION, ACCESSION, SOURCE, FEATURES ir ORIGIN, kad kartu su sekvenconija būtų saugomi turtingi biologiniai metaduomenys.