Plik płaski GenBank (.gb)
NCBI StandardowyPłaski plik NCBI GenBank (.gb / .gbk) to złoty standard genomicznego formatu adnotacji utrzymywany przez Narodowe Instytuty Zdrowia (NIH), łączący kompletne sekwencje DNA ze szczegółowymi lokalizacjami genów, regionami kodującymi oraz cytatami z literatury naukowej.
Konwertuj FASTA na GENBANK
Darmowy konwerter z FASTA na GENBANK w przeglądarce. Konwertuj pliki natychmiast na swoim urządzeniu.
Inspekcja i metadane
Systemy operacyjne i analizatory plików identyfikują pliki GenBank, sprawdzając początkową sekwencję bajtów binarnych:
Podpis nagłówka na poziomie bajtów (Magic Bytes)
Systemy operacyjne i analizatory plików identyfikują pliki GenBank, sprawdzając początkową sekwencję bajtów binarnych:
PODPIS HEX (OFFSET 0):
4C 4F 43 55 53 20 20 20 20 20REPREZENTACJA ASCII: LOCUS
Normalizacja: NCBI GenBank Release Specification
Specyfikacja techniczna
| Architektura kontenera | Plaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//' |
| Kompresja | Uncompressed text (often compressed with Gzip as .gb.gz) |
| Kolejność bajtów (Endianness) | UTF-8 / ASCII text stream |
| Przestrzenie kolorów | N/A (Genomic Annotation Database) |
| Kanały i struktura | DNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations |
| Maks. wymiary | Unbounded sequence and feature count |
| Przezroczystość | None |
| Streaming i progresywne ładowanie | Record-by-record streaming: individual GenBank entries are delimited by '//' lines |
Techniczna macierz porównawcza: GenBank a konkurencja
| Atrybut techniczny | GenBank (Bieżący) | FASTA | GFF | FASTQ |
|---|---|---|---|---|
| Szczegółowość adnotacji | Wyczerpująca (geny, CDS, cytowania, translacja) | Brak (tylko sekwencja) | Tabelaryczne współrzędne genomiczne | Tylko wyniki jakości sekwencjonowania |
| Zawartość sekwencji | Tak (w bloku ORIGIN na końcu) | Tak (czysta sekwencja) | Nie (tylko współrzędne) | Tak (surowe odczyty) |
| Główne narzędzia | NCBI, SnapGene, Benchling | BLAST, narzędzia do dopasowywania | Przeglądarki genomów (UCSC, IGV) | Sekwenatory Illumina |
| Separator rekordu | // w osobnej linii | Następna linia nagłówka '>' | Koniec pliku | Następna linia '@' |
Typowe tryby uszkodzeń i przewodnik odzyskiwania szesnastkowego
Oprogramowanie bioinformatyczne zgłasza błąd: 'GenBank parser error: premature EOF before //'.
Główna przyczyna: Ucięte pobieranie pliku, które obcięło końcowy blok początku sekwencji lub ogranicznik '//'.
Odzyskiwanie: Dołącz '//\n' na końcu pliku za pomocą narzędzia File2File Bioinformatics Tool.
Analiza bezpieczeństwa i wektory ataku na parser
Parsery GenBanku przetwarzają złożone ciągi lokalizacji cech, w których nawrót wyrażeń regularnych może wywołać odmowę usługi.
Znane wektory ataku
- Atak ReDoS (Regular expression denial of service) w parserach złożonych lokalizacji cech.
- Przepełnienie bufora podczas odczytywania nadmiernie długich tytułów cytowanych publikacji.
- Odmowa usługi poprzez zapętlone odniesienia do cech kołowych.
Najlepsze praktyki obronne:
Pochodzenie historyczne i kamienie milowe
Główne zalety
- Bogate, kompleksowe metadane: przechowuje granice genów, lokalizacje promotorów, eksony, introny oraz przetłumaczone sekwencje białkowe.
- Zawiera kompletne odniesienia do literatury naukowej, identyfikatorzy PubMed, nazwiska autorów oraz daty nadesłania eksperymentu.
- Uniwersalny format wymiany dla biologii syntetycznej, projektowania plazmidów (SnapGene) oraz przesyłania danych do baz NCBI.
Ograniczenia techniczne i wady
- Znacznie bardziej szczegółowe i większe rozmiary plików niż w przypadku zwykłych sekwencji FASTA.
- Analiza współrzędnych tabeli cech ('join(complement(100..500),600..800)') wymaga skomplikowanej logiki parsera.
- Nie został zaprojektowany z myślą o dopasowywaniu masowych odczytów z sekwencjonowania o wysokiej przepustowości.
Ciekawe informacje techniczne
- Każdy wpis w GenBanku zaczyna się od słowa 'LOCUS' i kończy dwoma ukośnikami '//' w osobnej linii.
- GenBank codziennie synchronizuje swoje dane z Europejskim Laboratorium Biologii Molekularnej (EMBL) oraz Japońskim Bankiem Danych DNA (DDBJ).
- Biolodzy syntetyczni używają plików GenBank do projektowania niestandardowych plazmidów kołowych do edycji genów metodą CRISPR oraz produkcji insuliny.
Często zadawane pytania techniczne
Jaka jest różnica między formatem FASTA a GenBank?
FASTA zawiera tylko surową sekwencję DNA z krótką linią nagłówka. GenBank zawiera surową sekwencję ORAZ wszystkie adnotacje genowe, translacje białek, autorów i notatki naukowe.
Jak mogę przekonwertować plik GenBank (.gb) do formatu FASTA?
Możesz przekonwertować pliki GenBank na czyste sekwencje nukleotydowe lub białkowe FASTA jednym kliknięciem za pomocą File2File.app bezpośrednio w przeglądarce.
Jakie oprogramowanie otwiera pliki GenBank?
SnapGene, Benchling, UGENE, Artemis oraz File2File.app pozwalają przeglądać i edytować pliki GenBank.
Powiązane pary konwersji GenBank
Konwersja zwykłej sekwencji FASTA na plik płaski GenBank dodaje niezbędne adnotacje biologiczne i metadane do surowego kodu genetycznego.
Konwersja pliku płaskiego GenBank na sekwencję FASTA usuwa metadane adnotacji, pozostawiając jedynie surowe sekwencje nukleotydów lub aminokwasów niezbędne do szybkiej analizy bioinformatycznej.