Plik płaski GenBank (.gb)

NCBI Standardowy

Płaski plik NCBI GenBank (.gb / .gbk) to złoty standard genomicznego formatu adnotacji utrzymywany przez Narodowe Instytuty Zdrowia (NIH), łączący kompletne sekwencje DNA ze szczegółowymi lokalizacjami genów, regionami kodującymi oraz cytatami z literatury naukowej.

Konwertuj FASTA na GENBANK

Darmowy konwerter z FASTA na GENBANK w przeglądarce. Konwertuj pliki natychmiast na swoim urządzeniu.

Inspekcja i metadane

Systemy operacyjne i analizatory plików identyfikują pliki GenBank, sprawdzając początkową sekwencję bajtów binarnych:

Wybierz lub upuść pliki tutaj

Konwersja w 100% prywatna w przeglądarce - pliki nigdy nie opuszczają Twojego urządzenia

lub wklej Ctrl+V
Gwarancja prywatności bez przesyłania danych do sieci: 0 bajtów przesłanych na zewnętrzne serwery. Całe przetwarzanie odbyło się lokalnie w piaskownicy przeglądarki.

Podpis nagłówka na poziomie bajtów (Magic Bytes)

Systemy operacyjne i analizatory plików identyfikują pliki GenBank, sprawdzając początkową sekwencję bajtów binarnych:

PODPIS HEX (OFFSET 0):

4C 4F 43 55 53 20 20 20 20 20

REPREZENTACJA ASCII: LOCUS

Normalizacja: NCBI GenBank Release Specification

Specyfikacja techniczna

Architektura konteneraPlaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//'
KompresjaUncompressed text (often compressed with Gzip as .gb.gz)
Kolejność bajtów (Endianness)UTF-8 / ASCII text stream
Przestrzenie kolorówN/A (Genomic Annotation Database)
Kanały i strukturaDNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations
Maks. wymiaryUnbounded sequence and feature count
PrzezroczystośćNone
Streaming i progresywne ładowanieRecord-by-record streaming: individual GenBank entries are delimited by '//' lines

Techniczna macierz porównawcza: GenBank a konkurencja

Atrybut technicznyGenBank (Bieżący)FASTAGFFFASTQ
Szczegółowość adnotacjiWyczerpująca (geny, CDS, cytowania, translacja)Brak (tylko sekwencja)Tabelaryczne współrzędne genomiczneTylko wyniki jakości sekwencjonowania
Zawartość sekwencjiTak (w bloku ORIGIN na końcu)Tak (czysta sekwencja)Nie (tylko współrzędne)Tak (surowe odczyty)
Główne narzędziaNCBI, SnapGene, BenchlingBLAST, narzędzia do dopasowywaniaPrzeglądarki genomów (UCSC, IGV)Sekwenatory Illumina
Separator rekordu// w osobnej liniiNastępna linia nagłówka '>'Koniec plikuNastępna linia '@'

Typowe tryby uszkodzeń i przewodnik odzyskiwania szesnastkowego

Oprogramowanie bioinformatyczne zgłasza błąd: 'GenBank parser error: premature EOF before //'.

Główna przyczyna: Ucięte pobieranie pliku, które obcięło końcowy blok początku sekwencji lub ogranicznik '//'.

Odzyskiwanie: Dołącz '//\n' na końcu pliku za pomocą narzędzia File2File Bioinformatics Tool.

Analiza bezpieczeństwa i wektory ataku na parser

Parsery GenBanku przetwarzają złożone ciągi lokalizacji cech, w których nawrót wyrażeń regularnych może wywołać odmowę usługi.

Znane wektory ataku

  • Atak ReDoS (Regular expression denial of service) w parserach złożonych lokalizacji cech.
  • Przepełnienie bufora podczas odczytywania nadmiernie długich tytułów cytowanych publikacji.
  • Odmowa usługi poprzez zapętlone odniesienia do cech kołowych.

Najlepsze praktyki obronne:

Pochodzenie historyczne i kamienie milowe

2023Baza danych GenBank przekracza 2,5 miliarda sekwencji nukleotydowych i 3 biliony par zasad.
1992NCBI przejmuje pełne zarządzanie GenBankiem od Los Alamos National Laboratory.
1982Stworzony przez Waltera Goada w Los Alamos National Laboratory w ramach finansowania NIH.

Główne zalety

  • Bogate, kompleksowe metadane: przechowuje granice genów, lokalizacje promotorów, eksony, introny oraz przetłumaczone sekwencje białkowe.
  • Zawiera kompletne odniesienia do literatury naukowej, identyfikatorzy PubMed, nazwiska autorów oraz daty nadesłania eksperymentu.
  • Uniwersalny format wymiany dla biologii syntetycznej, projektowania plazmidów (SnapGene) oraz przesyłania danych do baz NCBI.

Ograniczenia techniczne i wady

  • Znacznie bardziej szczegółowe i większe rozmiary plików niż w przypadku zwykłych sekwencji FASTA.
  • Analiza współrzędnych tabeli cech ('join(complement(100..500),600..800)') wymaga skomplikowanej logiki parsera.
  • Nie został zaprojektowany z myślą o dopasowywaniu masowych odczytów z sekwencjonowania o wysokiej przepustowości.

Ciekawe informacje techniczne

  • Każdy wpis w GenBanku zaczyna się od słowa 'LOCUS' i kończy dwoma ukośnikami '//' w osobnej linii.
  • GenBank codziennie synchronizuje swoje dane z Europejskim Laboratorium Biologii Molekularnej (EMBL) oraz Japońskim Bankiem Danych DNA (DDBJ).
  • Biolodzy syntetyczni używają plików GenBank do projektowania niestandardowych plazmidów kołowych do edycji genów metodą CRISPR oraz produkcji insuliny.

Często zadawane pytania techniczne

Jaka jest różnica między formatem FASTA a GenBank?

FASTA zawiera tylko surową sekwencję DNA z krótką linią nagłówka. GenBank zawiera surową sekwencję ORAZ wszystkie adnotacje genowe, translacje białek, autorów i notatki naukowe.

Jak mogę przekonwertować plik GenBank (.gb) do formatu FASTA?

Możesz przekonwertować pliki GenBank na czyste sekwencje nukleotydowe lub białkowe FASTA jednym kliknięciem za pomocą File2File.app bezpośrednio w przeglądarce.

Jakie oprogramowanie otwiera pliki GenBank?

SnapGene, Benchling, UGENE, Artemis oraz File2File.app pozwalają przeglądać i edytować pliki GenBank.