Sequência FASTA (.fasta)

Bioinformatics Padrão

O FASTA é o formato de arquivo fundamental e onipresente da bioinformática e genômica, representando sequências de nucleotídeos (DNA, RNA) e sequências de aminoácidos de proteínas usando códigos universais de letra única.

Converter FASTA para GENBANK

Conversor gratuito de FASTA para GENBANK no navegador. Converta arquivos instantaneamente no seu dispositivo.

Inspecionar e metadados

Sistemas operacionais e analisadores de arquivos identificam arquivos FASTA inspecionando a sequência de bytes binários inicial:

Selecione ou solte os arquivos aqui

Conversão 100% privada no navegador - os arquivos nunca saem do seu dispositivo

ou colar Ctrl+V
Garantia de Privacidade com Zero Transmissão de Rede: 0 bytes enviados para servidores externos. Todo o processamento ocorreu localmente no sandbox do seu navegador.

Assinatura de Cabeçalho em Nível de Byte (Magic Bytes)

Sistemas operacionais e analisadores de arquivos identificam arquivos FASTA inspecionando a sequência de bytes binários inicial:

ASSINATURA HEX (OFFSET 0):

3E

REPRESENTAÇÃO ASCII: >

Padronização: Bioinformatics de facto global standard

Especificações Técnicas

Arquitetura do ContêinerPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
CompressãoUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Ordem de Bytes (Endianness)ASCII / UTF-8 text stream
Espaços de CoresN/A (Genomic Sequence Data)
Canais e EstruturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Dimensões MáximasUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TransparênciaNone
Streaming e ProgressivoSequential record-by-record streaming processing

Matriz de Comparação Técnica: FASTA vs Concorrentes

Atributo TécnicoFASTA (Atual)FASTQGENBANKGFF
Pontuações de QualidadeNenhum (letras de sequência pura)Pontuações de qualidade Phred por baseNenhum (anotações de recursos)Nenhum (coordenadas de recursos)
Linha de CabeçalhoComeça com o caractere '>'Começa com o caractere '@'Bloco LOCUS estruturadoColunas genômicas delimitadas por tabulação
Uso PrincipalGenomas de referência e busca BLASTSequenciadores de alto rendimento brutos (Illumina)Genes anotados abrangentesAnotações de recursos genômicos
Tamanho do Arquivo (Humano)~3 Gigabytes descompactados~100+ Gigabytes (com qualidades)Texto rico de vários gigabytes~50 Megabytes

Modos Comuns de Corrupção e Guia de Recuperação Hex

A ferramenta de bioinformática relata 'Caractere de sequência inválido na linha X'.

Causa Raiz: Espaços em branco, números ou caracteres não IUPAC dentro das linhas de sequência.

Recuperação: Filtre e limpe os caracteres de sequência usando a Ferramenta de Bioinformática File2File.

Análise de Segurança e Vetores de Ataque ao Analisador

Ferramentas de genômica analisam arquivos FASTA massivos de vários gigabytes onde estouros de inteiros podem ocorrer ao indexar coordenadas de sequência.

Vetores de Ataque Conhecidos

  • Estouro de inteiro em indexadores de sequência de 32 bits (FAI) excedendo 2^31 pares de bases.
  • Estouro de buffer ao ler cabeçalhos de identificadores de sequência excessivamente longos.
  • Negação de serviço através de consultas de alinhamento patológicas.

Melhores Práticas Defensivas:

Origens Históricas e Marcos

2003O Projeto Genoma Humano conclui o primeiro sequenciamento do genoma humano, publicando os resultados no formato FASTA.
1990O BLAST (Basic Local Alignment Search Tool) adota o FASTA como seu formato de entrada padrão.
1985William Pearson e David Lipman introduzem o FASTA com o software de alinhamento de sequências FASTP.

Principais Vantagens e Prós

  • O padrão global incontestável da biologia computacional: usado por todas as ferramentas genômicas, sequenciadores e bancos de dados do planeta.
  • Simplicidade extrema: a linha 1 começa com '>' seguida por um ID, seguido por letras genéticas em texto puro.
  • Capacidade para várias sequências: um único arquivo pode conter milhares de genes individuais ou genomas virais completos.

Limitações Técnicas e Contras

  • Não contém pontuações de qualidade de sequenciamento (ao contrário do FASTQ, que armazena pontuações de confiança Phred por base).
  • Nenhuma sintaxe de metadados padronizada para linhas de cabeçalho além do identificador inicial.
  • Pegada de armazenamento enorme para conjuntos de dados de genoma inteiro sem Gzip ou compressão genômica especializada.

Curiosidades Técnicas

  • Todo o genoma humano de 3 bilhões de pares de bases pode ser representado no formato FASTA, ocupando cerca de 3 gigabytes de armazenamento.
  • As quatro letras de DNA armazenadas em arquivos FASTA são A (Adenina), C (Citosina), G (Guanina) e T (Timina).
  • Quando o genoma do coronavírus COVID-19 foi sequenciado pela primeira vez em janeiro de 2020, os cientistas o compartilharam globalmente como um arquivo FASTA de 30.000 letras.

Perguntas Técnicas Frequentes

O que é um arquivo FASTA?

Um arquivo FASTA é um arquivo de texto simples usado na biologia para armazenar sequências de DNA, RNA ou proteínas usando abreviações de uma única letra.

Qual é a diferença entre FASTA e FASTQ?

O FASTA armazena apenas as letras da sequência genética, enquanto o FASTQ armazena tanto as letras quanto a pontuação de qualidade de precisão de sequenciamento para cada base.

Como posso visualizar um arquivo FASTA?

Você pode abrir arquivos FASTA em qualquer editor de texto, visualizá-los em softwares de bioinformática como Jalview ou UGENE, ou convertê-los usando o File2File.app.