FASTA-sekvens (.fasta)

Bioinformatics Standard

FASTA er det allestedsnærværende, fundamentale filformat inden for bioinformatik og genomik, der repræsenterer nukleotidsekvenser (DNA, RNA) og aminosyre-proteinsekvenser ved hjælp af universelle enkeltbogstavskoder.

Konverter FASTA til GENBANK

Gratis FASTA til GENBANK-konverter i browseren. Konverter filer med det samme på din enhed.

Undersøg & Metadata

Operativsystemer og filanalysatorer identificerer FASTA-filer ved at inspicere den indledende binære bytesekvens:

Vælg eller træk filer hertil

100% privat konvertering i browseren - filer forlader aldrig din enhed

eller indsæt Ctrl+V
Privatlivsgaranti uden netværksoverførsel: 0 bytes uploadet til eksterne servere. Al behandling foregik lokalt i din browsers sandkasse.

Byte-niveau Header-signatur (Magic Bytes)

Operativsystemer og filanalysatorer identificerer FASTA-filer ved at inspicere den indledende binære bytesekvens:

HEX-SIGNATUR (OFFSET 0):

3E

ASCII-REPRÆSENTATION: >

Standardisering: Bioinformatics de facto global standard

Tekniske specifikationer

ContainerarkitekturPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KomprimeringUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
BytterejsningASCII / UTF-8 text stream
FarverumN/A (Genomic Sequence Data)
Kanaler og strukturNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maks. dimensionerUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
GennemsigtighedNone
Streaming og progressivSequential record-by-record streaming processing

Tekniske sammenligningsmatrix: FASTA vs. konkurrenter

Teknisk attributFASTA (Aktuel)FASTQGENBANKGFF
KvalitetsscorerIngen (rene sekvensbogstaver)Phred-kvalitetsscorer pr. baseIngen (egenskabsannotationer)Ingen (egenskabskoordinater)
HeaderlinjeStarter med tegnet '>'Starter med tegnet '@'Struktureret LOCUS-blokTabulatorseparerede genomiske kolonner
Primær anvendelseReferencegenomer og BLAST-søgningRå high-throughput-sekventeringsapparater (Illumina)Omfattende annoterede generGenomiske egenskabsannotationer
Filstørrelse (Humane)~3 gigabyte ukomprimeret~100+ gigabyte (med kvaliteter)Rig tekst på flere gigabyte~50 megabyte

Almindelige korruptionstilstande og hex-gendannelsesvejledning

Bioinformatikværktøj rapporterer 'Ugyldigt sekvenstegn på linje X'.

Grundlæggende årsag: Hvide mellemrum, tal eller ikke-IUPAC-tegn inde i sekvenslinjerne.

Gendannelse: Filtrer og rens sekvenstegn ved hjælp af File2File Bioinformatics Tool.

Sikkerhedsanalyse og parser-angrebsvektorer

Genomikværktøjer parser massive multi-gigabyte FASTA-filer, hvor heltals-overløb kan forekomme ved indeksering af sekvenskoordinater.

Kendte angrebsvektorer

  • Heltalsoverløb i 32-bit sekvensindekserere (FAI) der overstiger 2^31 basepar.
  • Bufferoverløb ved læsning af overdrevne lange sekvensidentifikationsheaders.
  • Nægtelse af tjeneste gennem patologiske justeringsforespørgsler.

Defensive bedste praksisser:

Historisk oprindelse og milepæle

2003Human Genome Project fuldender den første sekventering af det menneskelige genom og offentliggør resultaterne i FASTA-format.
1990BLAST (Basic Local Alignment Search Tool) vedtager FASTA som sit standardinputformat.
1985William Pearson og David Lipman introducerer FASTA med sekvensjusteringssoftwaren FASTP.

Vigtige fordele og styrker

  • Den ubestridte globale standard for beregningsmæssig biologi: bruges af ethvert genomisk værktøj, sekventeringsapparat og database på Jorden.
  • Ekstrem enkelheid: linje 1 starter med '>' efterfulgt af et ID, efterfulgt af genetiske bogstaver i almindelig tekst.
  • Kapacitet til flere sekvenser: En enkelt fil kan indeholde tusindvis af individuelle gener eller komplette virale genomer.

Tekniske begrænsninger og ulemper

  • Indeholder ingen sekventeringskvalitetsscorer (i modsætning til FASTQ, som gemmer Phred-tillidsscorer pr. base).
  • Ingen standardiseret metadatasynaks for headerlinjer ud over den første identifikator.
  • Enormt lagringsfodaftryk for hele genom-datasæt uden Gzip eller specialiseret genomisk komprimering.

Interessant teknisk trivia

  • Det hele 3 milliarder basepar lange humane genom kan repræsenteres i FASTA-format og tager ca. 3 gigabyte lagerplads.
  • De fire bogstaver i DNA, der er gemt i FASTA-filer, er A (Adenin), C (Cytosin), G (Guanin) og T (Thymin).
  • Da COVID-19-coronavirusgenomet først blev sekventeret i januar 2020, delte forskere det globalt som en 30.000 bogstaver lang FASTA-fil.

Ofte stillede tekniske spørgsmål

Hvad er en FASTA-fil?

En FASTA-fil er en almindelig tekstfil, der bruges inden for biologien til at gemme DNA-, RNA- eller proteinsekvenser ved hjælp af enkeltbogstavsforkortelser.

Hvad er forskellen mellem FASTA og FASTQ?

FASTA gemmer kun de genetiske sekvensbogstaver, hvorimod FASTQ gemmer både bogstaverne og en kvalitetsscore for sekventeringsnøjagtigheden for hver base.

Hvordan kan jeg se en FASTA-fil?

Du kan åbne FASTA-filer i enhver teksteditor, se dem i bioinformatiksoftware som Jalview eller UGENE eller konvertere dem ved hjælp af File2File.app.