Sequência FASTA (.fasta)
Bioinformatics PadrãoO FASTA é o formato de arquivo fundamental e onipresente da bioinformática e genômica, representando sequências de nucleotídeos (DNA, RNA) e sequências de aminoácidos de proteínas usando códigos universais de letra única.
Converter FASTA para GENBANK
Conversor gratuito de FASTA para GENBANK no navegador. Converta arquivos instantaneamente no seu dispositivo.
Inspecionar e metadados
Sistemas operacionais e analisadores de arquivos identificam arquivos FASTA inspecionando a sequência de bytes binários inicial:
Assinatura de Cabeçalho em Nível de Byte (Magic Bytes)
Sistemas operacionais e analisadores de arquivos identificam arquivos FASTA inspecionando a sequência de bytes binários inicial:
ASSINATURA HEX (OFFSET 0):
3EREPRESENTAÇÃO ASCII: >
Padronização: Bioinformatics de facto global standard
Especificações Técnicas
| Arquitetura do Contêiner | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Compressão | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Ordem de Bytes (Endianness) | ASCII / UTF-8 text stream |
| Espaços de Cores | N/A (Genomic Sequence Data) |
| Canais e Estrutura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Dimensões Máximas | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Transparência | None |
| Streaming e Progressivo | Sequential record-by-record streaming processing |
Matriz de Comparação Técnica: FASTA vs Concorrentes
| Atributo Técnico | FASTA (Atual) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Pontuações de Qualidade | Nenhum (letras de sequência pura) | Pontuações de qualidade Phred por base | Nenhum (anotações de recursos) | Nenhum (coordenadas de recursos) |
| Linha de Cabeçalho | Começa com o caractere '>' | Começa com o caractere '@' | Bloco LOCUS estruturado | Colunas genômicas delimitadas por tabulação |
| Uso Principal | Genomas de referência e busca BLAST | Sequenciadores de alto rendimento brutos (Illumina) | Genes anotados abrangentes | Anotações de recursos genômicos |
| Tamanho do Arquivo (Humano) | ~3 Gigabytes descompactados | ~100+ Gigabytes (com qualidades) | Texto rico de vários gigabytes | ~50 Megabytes |
Modos Comuns de Corrupção e Guia de Recuperação Hex
A ferramenta de bioinformática relata 'Caractere de sequência inválido na linha X'.
Causa Raiz: Espaços em branco, números ou caracteres não IUPAC dentro das linhas de sequência.
Recuperação: Filtre e limpe os caracteres de sequência usando a Ferramenta de Bioinformática File2File.
Análise de Segurança e Vetores de Ataque ao Analisador
Ferramentas de genômica analisam arquivos FASTA massivos de vários gigabytes onde estouros de inteiros podem ocorrer ao indexar coordenadas de sequência.
Vetores de Ataque Conhecidos
- Estouro de inteiro em indexadores de sequência de 32 bits (FAI) excedendo 2^31 pares de bases.
- Estouro de buffer ao ler cabeçalhos de identificadores de sequência excessivamente longos.
- Negação de serviço através de consultas de alinhamento patológicas.
Melhores Práticas Defensivas:
Origens Históricas e Marcos
Principais Vantagens e Prós
- O padrão global incontestável da biologia computacional: usado por todas as ferramentas genômicas, sequenciadores e bancos de dados do planeta.
- Simplicidade extrema: a linha 1 começa com '>' seguida por um ID, seguido por letras genéticas em texto puro.
- Capacidade para várias sequências: um único arquivo pode conter milhares de genes individuais ou genomas virais completos.
Limitações Técnicas e Contras
- Não contém pontuações de qualidade de sequenciamento (ao contrário do FASTQ, que armazena pontuações de confiança Phred por base).
- Nenhuma sintaxe de metadados padronizada para linhas de cabeçalho além do identificador inicial.
- Pegada de armazenamento enorme para conjuntos de dados de genoma inteiro sem Gzip ou compressão genômica especializada.
Curiosidades Técnicas
- Todo o genoma humano de 3 bilhões de pares de bases pode ser representado no formato FASTA, ocupando cerca de 3 gigabytes de armazenamento.
- As quatro letras de DNA armazenadas em arquivos FASTA são A (Adenina), C (Citosina), G (Guanina) e T (Timina).
- Quando o genoma do coronavírus COVID-19 foi sequenciado pela primeira vez em janeiro de 2020, os cientistas o compartilharam globalmente como um arquivo FASTA de 30.000 letras.
Perguntas Técnicas Frequentes
O que é um arquivo FASTA?
Um arquivo FASTA é um arquivo de texto simples usado na biologia para armazenar sequências de DNA, RNA ou proteínas usando abreviações de uma única letra.
Qual é a diferença entre FASTA e FASTQ?
O FASTA armazena apenas as letras da sequência genética, enquanto o FASTQ armazena tanto as letras quanto a pontuação de qualidade de precisão de sequenciamento para cada base.
Como posso visualizar um arquivo FASTA?
Você pode abrir arquivos FASTA em qualquer editor de texto, visualizá-los em softwares de bioinformática como Jalview ou UGENE, ou convertê-los usando o File2File.app.
Pares de Conversão de FASTA Relacionados
A conversão de uma sequência FASTA simples em um arquivo GenBank adiciona anotações biológicas essenciais e metadados ao código genético bruto.
A conversão de um arquivo GenBank em uma Sequência FASTA remove os metadados de anotação para deixar apenas as sequências brutas de nucleotídeos ou aminoácidos necessárias para análises rápidas de bioinformática.