GenBank 플랫파일 (.gb)
NCBI 표준NCBI GenBank 플랫 파일(.gb / .gbk)은 미국 국립보건원(NIH)이 유지 관리하는 최고 표준 유전체 주석 포맷으로, 완전한 DNA 서열과 상세한 유전자 위치, 코딩 영역, 과학 문헌 인용 정보를 결합하여 제공합니다.
FASTA을(를) GENBANK(으)로 변환
무료 브라우저 내 FASTA-GENBANK 변환기. 기기에서 파일을 즉시 변환하세요.
검사 및 메타데이터
운영 체제와 파일 분석기는 파일 선두의 바이너리 바이트 시퀀스를 검사하여 GenBank 파일을 식별합니다:
바이트 단위 헤더 시그니처 (매직 바이트)
운영 체제와 파일 분석기는 파일 선두의 바이너리 바이트 시퀀스를 검사하여 GenBank 파일을 식별합니다:
16진수 시그니처 (오프셋 0):
4C 4F 43 55 53 20 20 20 20 20ASCII 표현: LOCUS
표준화: NCBI GenBank Release Specification
기술 사양
| 컨테이너 아키텍처 | Plaintext flat file divided into Header section (LOCUS, DEFINITION, ACCESSION), FEATURES table, and ORIGIN sequence data ending with '//' |
| 압축 | Uncompressed text (often compressed with Gzip as .gb.gz) |
| 바이트 엔디안 | UTF-8 / ASCII text stream |
| 색 공간 | N/A (Genomic Annotation Database) |
| 채널 및 구조 | DNA/RNA sequence, gene annotations, coding regions (CDS), protein translations, and scientific citations |
| 최대 크기 | Unbounded sequence and feature count |
| 투명도 | None |
| 스트리밍 및 프로그레시브 | Record-by-record streaming: individual GenBank entries are delimited by '//' lines |
기술 비교 매트릭스: GenBank 대 경쟁사
| 기술적 속성 | GenBank (현재) | FASTA | GFF | FASTQ |
|---|---|---|---|---|
| 주석 상세도 | 방대함 (유전자, CDS, 인용, 번역) | 없음 (서열 전용) | 표 형식의 유전체 좌표 | 시퀀싱 품질 점수 전용 |
| 서열 포함 여부 | 예 (끝의 ORIGIN 블록에 포함) | 예 (순수 서열) | 아니오 (좌표 전용) | 예 (원시 리드) |
| 주요 도구 | NCBI, SnapGene, Benchling | BLAST, 정렬 도구 | 유전체 브라우저 (UCSC, IGV) | 일루미나 시퀀서 |
| 레코드 종료자 | 독립된 줄의 // | 다음 '>' 헤더 줄 | 파일 끝 | 다음 '@' 줄 |
일반적인 손상 모드 및 헥스 복구 가이드
생물정보학 소프트웨어 오류: 'GenBank 파서 오류: // 이전의 조기 EOF'.
근본 원인: 최종 서열 origin 블록 또는 '//' 구분선이 잘린 불완전한 다운로드입니다.
복구: File2File 생물정보학 툴을 사용하여 파일 끝에 '//\n'을 추가하세요.
보안 분석 및 파서 공격 벡터
GenBank 파서는 복잡한 피처 위치 문자열을 처리하며, 이 과정에서 정규표현식 백트래킹으로 인해 서비스 거부가 발생할 수 있습니다.
알려진 공격 벡터
- 복잡한 피처 위치 파서의 정규표현식 서비스 거부(ReDoS).
- 지나치게 긴 인용 참조 제목을 읽을 때 발생하는 버퍼 오버플로우.
- 순환 피처 참조 루프로 인한 서비스 거부.
방어적 모범 사례:
역사적 배경 및 주요 이력
주요 장점
- 풍부하고 포괄적인 메타데이터: 유전자 경계, 프로모터 위치, 엑손, 인트론 및 번역된 단백질 서열을 저장합니다.
- 완전한 과학 문헌 참조, PubMed ID, 저자 이름 및 실험 제출 날짜를 포함합니다.
- 합성 생물학, 플라스미드 디자인(SnapGene) 및 NCBI 데이터베이스 제출을 위한 보편적인 상호 교환 포맷입니다.
기술적 제한 사항 및 단점
- 일반 FASTA 서열에 비해 파일 크기가 훨씬 크고 장황합니다.
- 피처 테이블 좌표('join(complement(100..500),600..800)')를 파싱하려면 복잡한 파서 로직이 필요합니다.
- 대규모 고속 대량 시퀀싱 리드 정렬용으로 설계되지 않았습니다.
흥미로운 기술적 상식
- 모든 GenBank 항목은 'LOCUS'라는 단어로 시작하며, 독립된 줄에 있는 두 개의 슬래시 '//'로 끝납니다.
- GenBank는 유럽 분자생물학 연구소(EMBL) 및 일본 DNA 데이터 뱅크(DDBJ)와 매일 데이터를 동기화합니다.
- 합성 생물학자들은 CRISPR 유전자 가위 편집 및 인슐린 생산을 위한 맞춤형 원형 플라스미드를 디자인할 때 GenBank 파일을 사용합니다.
자주 묻는 기술 질문
FASTA 형식과 GenBank 형식의 차이점은 무엇인가요?
FASTA는 간략한 헤더 줄과 함께 원본 DNA 서열만 포함합니다. GenBank는 원본 서열에 더하여 모든 유전자 주석, 단백질 번역, 저자 및 과학적 주석을 포함합니다.
GenBank(.gb)를 FASTA로 어떻게 변환하나요?
브라우저에서 바로 File2File.app을 사용하여 클릭 한 번으로 GenBank 파일을 깔끔한 FASTA 뉴클레오타이드 또는 단백질 서열로 변환할 수 있습니다.
GenBank 파일을 여는 소프트웨어는 무엇인가요?
SnapGene, Benchling, UGENE, Artemis 및 File2File.app을 사용하여 GenBank 파일을 보고 편집할 수 있습니다.