FASTA 서열 (.fasta)

Bioinformatics 표준

FASTA는 생물정보학 및 유전체의 보편적인 기본 파일 형식으로, 범용 단일 문자 코드를 사용하여 뉴클레오티드 서열(DNA, RNA) 및 아미노산 단백질 서열을 나타냅니다.

FASTA을(를) GENBANK(으)로 변환

무료 브라우저 내 FASTA-GENBANK 변환기. 기기에서 파일을 즉시 변환하세요.

검사 및 메타데이터

운영 체제와 파일 분석기는 파일 선두의 바이너리 바이트 시퀀스를 검사하여 FASTA 파일을 식별합니다:

여기에 파일을 선택하거나 놓으세요

100% 브라우저 내 프라이버시 변환 - 파일이 기기를 절대 떠나지 않습니다

또는 붙여넣기 Ctrl+V
제로 네트워크 전송 프라이버시 보장: 외부 서버로 업로드된 데이터 0바이트. 모든 처리는 브라우저 샌드박스내에서 로컬로 수행되었습니다.

바이트 단위 헤더 시그니처 (매직 바이트)

운영 체제와 파일 분석기는 파일 선두의 바이너리 바이트 시퀀스를 검사하여 FASTA 파일을 식별합니다:

16진수 시그니처 (오프셋 0):

3E

ASCII 표현: >

표준화: Bioinformatics de facto global standard

기술 사양

컨테이너 아키텍처Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
압축Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
바이트 엔디안ASCII / UTF-8 text stream
색 공간N/A (Genomic Sequence Data)
채널 및 구조Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
최대 크기Unbounded sequence length (supports entire human chromosomes over 250 million base pairs)
투명도None
스트리밍 및 프로그레시브Sequential record-by-record streaming processing

기술 비교 매트릭스: FASTA 대 경쟁사

기술적 속성FASTA (현재)FASTQGENBANKGFF
품질 점수없음 (순수 서열 문자)염기별 Phred 품질 점수없음 (기능 주석)없음 (기능 좌표)
헤더 줄'>' 문자로 시작'@' 문자로 시작구조화된 LOCUS 블록탭으로 구분된 유전체 열
기본 용도참조 게놈 및 BLAST 검색원시 고처리량 시퀀서 (Illumina)포괄적인 주석이 달린 유전자유전체 기능 주석
파일 크기 (인간)압축되지 않은 상태로 ~3기가바이트~100기가바이트 이상 (품질 포함)다중 gigabyte 서식 있는 텍스트~50메가바이트

일반적인 손상 모드 및 헥스 복구 가이드

생물정보학 도구가 '라인 X에 잘못된 서열 문자'를 보고합니다.

근본 원인: 서열 줄 내의 공백, 숫자 또는 비IUPAC 문자.

복구: File2File Bioinformatics Tool을 사용하여 서열 문자를 필터링하고 정리합니다.

보안 분석 및 파서 공격 벡터

유전체학 도구는 서열 좌표에 인덱싱할 때 정수 오버플로가 발생할 수 있는 대규모 멀티 gigabyte FASTA 파일을 파싱합니다.

알려진 공격 벡터

  • 2^31 염기쌍을 초과하는 32비트 서열 인덱서(FAI)의 정수 오버플로.
  • 지나치게 긴 서열 식별자 헤더를 읽을 때의 버퍼 오버플로.
  • 병리학적 정렬 쿼리를 통한 서비스 거부.

방어적 모범 사례:

역사적 배경 및 주요 이력

2003인간 게놈 프로젝트가 인간 게놈의 첫 번째 시퀀싱을 완료하고 결과를 FASTA 형식으로 발행합니다.
1990BLAST(기본 로컬 정렬 검색 도구)가 표준 입력 형식으로 FASTA를 채택합니다.
1985William Pearson과 David Lipman이 FASTP 서열 정렬 소프트웨어와 함께 FASTA를 소개합니다.

주요 장점

  • 컴퓨팅 생물학의 확고한 글로벌 표준: 지구상의 모든 유전체 도구, 시퀀서 및 데이터베이스에서 사용됩니다.
  • 극도의 단순성: 1줄은 ID가 뒤따르는 '>'로 시작하고 그 뒤에 일반 텍스트 유전적 문자가 옵니다.
  • 다중 서열 용량: 단일 파일에 수천 개의 개별 유전자 또는 완전한 바이러스 게놈이 포함될 수 있습니다.

기술적 제한 사항 및 단점

  • 시퀀싱 품질 점수가 포함되어 있지 않습니다 (염기별 Phred 신뢰도 점수를 저장하는 FASTQ와 다름).
  • 초기 식별자를 제외하고 헤더 줄에 대한 표준화된 메타데이터 구문이 없습니다.
  • Gzip 또는 특수 유전체 압축 없는 전체 게놈 데이터 세트에 대한 엄청난 저장 공간 풋프린트.

흥미로운 기술적 상식

  • 30억 염기쌍으로 이루어진 전체 인간 게놈은 FASTA 형식으로 표현될 수 있으며 약 3기가바이트의 저장용량을 차지합니다.
  • FASTA 파일에 저장된 DNA의 네 가지 문자는 A(아데닌), C(시토신), G(구아닌), T(티민)입니다.
  • 2020년 1월 COVID-19 코로나바이러스 게놈이 처음 시퀀싱되었을 때 과학자들은 이를 30,000자 길이의 FASTA 파일로 전 세계에 공유했습니다.

자주 묻는 기술 질문

FASTA 파일란 무엇인가요?

FASTA 파일은 생물학에서 한 글자 약어를 사용하여 DNA, RNA 또는 단백질 서열을 저장하는 데 사용되는 일반 텍스트 파일입니다.

FASTA와 FASTQ의 차이점은 무엇인가요?

FASTA는 유전적 서열 문자만 저장하고, FASTQ는 각 염기에 대한 문자과 시퀀싱 정확도 품질 점수를 모두 저장합니다.

FASTA 파일을 어떻게 볼 수 있나요?

모든 텍스트 편집기에서 FASTA 파일을 열거나, Jalview나 UGENE 같은 생물정보학 소프트웨어에서 보거나, File2File.app을 사용하여 변환할 수 있습니다.