FASTA 서열 (.fasta)
Bioinformatics 표준FASTA는 생물정보학 및 유전체의 보편적인 기본 파일 형식으로, 범용 단일 문자 코드를 사용하여 뉴클레오티드 서열(DNA, RNA) 및 아미노산 단백질 서열을 나타냅니다.
FASTA을(를) GENBANK(으)로 변환
무료 브라우저 내 FASTA-GENBANK 변환기. 기기에서 파일을 즉시 변환하세요.
검사 및 메타데이터
운영 체제와 파일 분석기는 파일 선두의 바이너리 바이트 시퀀스를 검사하여 FASTA 파일을 식별합니다:
바이트 단위 헤더 시그니처 (매직 바이트)
운영 체제와 파일 분석기는 파일 선두의 바이너리 바이트 시퀀스를 검사하여 FASTA 파일을 식별합니다:
16진수 시그니처 (오프셋 0):
3EASCII 표현: >
표준화: Bioinformatics de facto global standard
기술 사양
| 컨테이너 아키텍처 | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| 압축 | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| 바이트 엔디안 | ASCII / UTF-8 text stream |
| 색 공간 | N/A (Genomic Sequence Data) |
| 채널 및 구조 | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| 최대 크기 | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| 투명도 | None |
| 스트리밍 및 프로그레시브 | Sequential record-by-record streaming processing |
기술 비교 매트릭스: FASTA 대 경쟁사
| 기술적 속성 | FASTA (현재) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| 품질 점수 | 없음 (순수 서열 문자) | 염기별 Phred 품질 점수 | 없음 (기능 주석) | 없음 (기능 좌표) |
| 헤더 줄 | '>' 문자로 시작 | '@' 문자로 시작 | 구조화된 LOCUS 블록 | 탭으로 구분된 유전체 열 |
| 기본 용도 | 참조 게놈 및 BLAST 검색 | 원시 고처리량 시퀀서 (Illumina) | 포괄적인 주석이 달린 유전자 | 유전체 기능 주석 |
| 파일 크기 (인간) | 압축되지 않은 상태로 ~3기가바이트 | ~100기가바이트 이상 (품질 포함) | 다중 gigabyte 서식 있는 텍스트 | ~50메가바이트 |
일반적인 손상 모드 및 헥스 복구 가이드
생물정보학 도구가 '라인 X에 잘못된 서열 문자'를 보고합니다.
근본 원인: 서열 줄 내의 공백, 숫자 또는 비IUPAC 문자.
복구: File2File Bioinformatics Tool을 사용하여 서열 문자를 필터링하고 정리합니다.
보안 분석 및 파서 공격 벡터
유전체학 도구는 서열 좌표에 인덱싱할 때 정수 오버플로가 발생할 수 있는 대규모 멀티 gigabyte FASTA 파일을 파싱합니다.
알려진 공격 벡터
- 2^31 염기쌍을 초과하는 32비트 서열 인덱서(FAI)의 정수 오버플로.
- 지나치게 긴 서열 식별자 헤더를 읽을 때의 버퍼 오버플로.
- 병리학적 정렬 쿼리를 통한 서비스 거부.
방어적 모범 사례:
역사적 배경 및 주요 이력
주요 장점
- 컴퓨팅 생물학의 확고한 글로벌 표준: 지구상의 모든 유전체 도구, 시퀀서 및 데이터베이스에서 사용됩니다.
- 극도의 단순성: 1줄은 ID가 뒤따르는 '>'로 시작하고 그 뒤에 일반 텍스트 유전적 문자가 옵니다.
- 다중 서열 용량: 단일 파일에 수천 개의 개별 유전자 또는 완전한 바이러스 게놈이 포함될 수 있습니다.
기술적 제한 사항 및 단점
- 시퀀싱 품질 점수가 포함되어 있지 않습니다 (염기별 Phred 신뢰도 점수를 저장하는 FASTQ와 다름).
- 초기 식별자를 제외하고 헤더 줄에 대한 표준화된 메타데이터 구문이 없습니다.
- Gzip 또는 특수 유전체 압축 없는 전체 게놈 데이터 세트에 대한 엄청난 저장 공간 풋프린트.
흥미로운 기술적 상식
- 30억 염기쌍으로 이루어진 전체 인간 게놈은 FASTA 형식으로 표현될 수 있으며 약 3기가바이트의 저장용량을 차지합니다.
- FASTA 파일에 저장된 DNA의 네 가지 문자는 A(아데닌), C(시토신), G(구아닌), T(티민)입니다.
- 2020년 1월 COVID-19 코로나바이러스 게놈이 처음 시퀀싱되었을 때 과학자들은 이를 30,000자 길이의 FASTA 파일로 전 세계에 공유했습니다.
자주 묻는 기술 질문
FASTA 파일란 무엇인가요?
FASTA 파일은 생물학에서 한 글자 약어를 사용하여 DNA, RNA 또는 단백질 서열을 저장하는 데 사용되는 일반 텍스트 파일입니다.
FASTA와 FASTQ의 차이점은 무엇인가요?
FASTA는 유전적 서열 문자만 저장하고, FASTQ는 각 염기에 대한 문자과 시퀀싱 정확도 품질 점수를 모두 저장합니다.
FASTA 파일을 어떻게 볼 수 있나요?
모든 텍스트 편집기에서 FASTA 파일을 열거나, Jalview나 UGENE 같은 생물정보학 소프트웨어에서 보거나, File2File.app을 사용하여 변환할 수 있습니다.