FASTA-sekvens (.fasta)

Bioinformatics Standard

FASTA er det uunnværlige grunnfilformatet innen bioinformatikk og genomikk, som representerer nukleotidsekvenser (DNA, RNA) og aminosyre-proteinsekvenser ved hjelp av universelle enkeltbokstavskoder.

Konverter FASTA til GENBANK

Gratis FASTA til GENBANK-konverterer i nettleseren. Konverter filer umiddelbart på enheten din.

Undersøk og metadata

Operativsystemer og filanalysatorer identifiserer FASTA-filer ved å undersøke den innledende binære bytesekvensen:

Velg eller slipp filer her

100 % privat in-browser-konvertering - filer forlater aldri enheten din

eller lim inn Ctrl+V
Personverngaranti uten nettverksoverføring: 0 byte lastet opp til eksterne servere. All behandling skjedde lokalt i nettlesersandkassen din.

Byte-nivå hodesignatur (Magic Bytes)

Operativsystemer og filanalysatorer identifiserer FASTA-filer ved å undersøke den innledende binære bytesekvensen:

HEX-SIGNATUR (OFFSET 0):

3E

ASCII-REPRESENTASJON: >

Standardisering: Bioinformatics de facto global standard

Tekniske spesifikasjoner

BeholderarkitekturPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KomprimeringUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
BytterekkefølgeASCII / UTF-8 text stream
FargeromN/A (Genomic Sequence Data)
Kanaler og strukturNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maks. dimensjonerUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
GjennomsiktighetNone
Strømming og progressivSequential record-by-record streaming processing

Teknisk sammenligningsmatrise: FASTA vs konkurrenter

Teknisk attributtFASTA (Gjeldende)FASTQGENBANKGFF
KvalitetsskårerIngen (rene sekvensbokstaver)Phred-kvalitetsskårer per baseIngen (funksjonsannoteringer)Ingen (funksjonskoordinater)
OverskriftslinjeStarter med tegnet '>'Starter med tegnet '@'Strukturert LOCUS-blokkTabulatorseparerte genomiske kolonner
Primær brukReferansegenomer og BLAST-søkRådata fra høykapasitetssekvensere (Illumina)Omfattende annoterte generGenomiske funksjonsannoteringer
Filstørrelse (Menneske)~3 Gigabyte ukomprimert~100+ Gigabyte (med kvaliteter)Flergigabytes rik tekst~50 Megabyte

Vanlige korrupsjonsmoduser og heksadesimal gjenopprettingsveiledning

Bioinformatikkverktøy rapporterer «Invalid sequence character at line X».

Underliggende årsak: Mellomrom, tall eller ikke-IUPAC-tegn inne i sekvenslinjene.

Utbedring: Filtrer og rengjør sekvenstegn ved hjelp av File2File Bioinformatics Tool.

Sikkerhetsanalyse og parser-angrepsvektorer

Genomikkverktøy analyserer massive FASTA-filer på flere gigabyte der heltallsoverflyt (integer overflow) kan oppstå ved indeksering av sekvenskoordinater.

Kjente angrepsvektorer

  • Heltallsoverflyt i 32-bits sekvensindekserere (FAI) som overstiger 2^31 basepar.
  • Bufferoverflyt ved lesing av overdrevent lange identifikatorhoder for sekvenser.
  • Tjenestenekt (Denial of Service) gjennom patologiske tilpasningsspørringer.

Beste praksis for forsvar:

Historisk opprinnelse og milepæler

2003Human Genome Project fullfører den første sekvenseringen av det menneskelige genomet og publiserer resultatene i FASTA-format.
1990BLAST (Basic Local Alignment Search Tool) tar i bruk FASTA som sitt standard inndataformat.
1985William Pearson og David Lipman introduserer FASTA sammen med FASTP-programvaren for sekvenstilpasning.

Viktige fordeler

  • Det ubestridte globale standardformatet innen beregningsbiologi: brukes av hvert eneste genomiske verktøy, sekvenseringsapparat og database på jorden.
  • Ekstrem enkelhet: linje 1 starter med '>' etterfulgt av en ID, etterfulgt av vanlijke genetiske tekstbokstaver.
  • Kapasitet for flere sekvenser: en enkelt fil kan inneholde tusenvis av individuelle gener eller komplette virusgenomer.

Tekniske begrensninger og ulemper

  • Inneholder ingen sekvenseringskvalitetsskårer (i motsetning til FASTQ, som lagrer Phred-konfidensskårer per base).
  • Ingen standardisert metadatasyntaks for overskriftslinjer utover den opprinnelige identifikatoren.
  • Enormt lagringsbehov for helgenomdatasett uten Gzip eller spesialisert genomisk komprimering.

Interessante tekniske fakta

  • Hele det menneskelige genomet på 3 milliarder basepar kan representeres i FASTA-format, som tar omtrent 3 gigabyte med lagringsplass.
  • De fire DNA-bokstavene som lagres i FASTA-filer, er A (Adenin), C (Cytosin), G (Guanin) og T (Thymin).
  • Da covid-19-koronavirusgenomet ble sekvensert for første gang i januar 2020, delte forskere det globalt som en FASTA-fil på 30 000 bokstaver.

Ofte stilte tekniske spørsmål

Hva er en FASTA-fil?

En FASTA-fil er en ren tekstfil som brukes i biologien til å lagre DNA-, RNA- eller proteinsekvenser ved hjelp av enkeltbokstavforkortelser.

Hva er forskjellen mellom FASTA og FASTQ?

FASTA lagrer bare de genetiske sekvensbokstavene, mens FASTQ lagrer både bokstavene og en nøyaktighets- eller kvalitetsscore for sekvenseringen for hver base.

Hvordan kan jeg se på en FASTA-fil?

Du kan åpne FASTA-filer i en hvilken som helst tekstredigerer, se dem i bioinformatikkprogramvare som Jalview eller UGENE, eller konvertere dem ved hjelp av File2File.app.