FASTA-sekvens (.fasta)

Bioinformatics Standard

FASTA är bioinformatikens och genomikens allestädes närvarande grundläggande filformat som representerar nukleotidsekvenser (DNA, RNA) och aminosyrasekvenser med universella enbokstavskoder.

Konvertera FASTA till GENBANK

Gratis konverterare från FASTA till GENBANK i webbläsaren. Konvertera filer direkt på din enhet.

Granska & Metadata

Operativsystem och filanalysverktyg identifierar FASTA-filer genom att granska den inledande binära bytesekvensen:

Välj eller släpp filer här

100 % privat konvertering i webbläsaren - filer lämnar aldrig din enhet

eller klistra in Ctrl+V
Integritetsgaranti utan nätverksöverföring: 0 byte laddas upp till externa servrar. All bearbetning sker lokalt i webbläsarens sandlåda.

Signatur för filhuvud på bytenivå (Magic Bytes)

Operativsystem och filanalysverktyg identifierar FASTA-filer genom att granska den inledande binära bytesekvensen:

HEX-SIGNATUR (OFFSET 0):

3E

ASCII-REPRESENTATION: >

Standardisering: Bioinformatics de facto global standard

Tekniska specifikationer

ContainerarkitekturPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KomprimeringUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
BytessordinningASCII / UTF-8 text stream
FärgrymderN/A (Genomic Sequence Data)
Kanaler och strukturNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maximala dimensionerUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TransparensNone
Strömning och progressivSequential record-by-record streaming processing

Teknisk jämförelsematris: FASTA vs konkurrenter

Tekniskt attributFASTA (Aktuell)FASTQGENBANKGFF
KvalitetspoängInga (rena sekvensbokstäver)Phred-kvalitetspoäng per basInga (funktionsanteckningar)Inga (funktionskoordinater)
HuvudradBörjar med tecknet '>'Börjar med tecknet '@'Strukturerat LOCUS-blockTabelldelade genomiska kolumner
Primär användningReferensgenom och BLAST-sökningRåa högt genomströmmande sekvenserare (Illumina)Omfattande annoterade generGenomiska funktionsanteckningar
Filstorlek (Människa)~3 gigabyte okomprimerat~100+ gigabyte (med egenskaper)Rik text på flera gigabyte~50 megabyte

Vanliga skadeorsaker och hex-återställningsguide

Bioinformatikverktyget rapporterar 'Ogiltigt sekvenstecken på rad X'.

Grundorsak: Mellanslag, siffror eller icke-IUPAC-tecken inuti sekvensraderna.

Återställning: Filtrera och rensa sekvenstecken med File2File Bioinformatics Tool.

Säkerhetsanalys och attackvektorer för tolkar

Genomikverktyg tolkar massiva FASTA-filer på flera gigabyte där heltalsspill kan inträffa vid indexering av sekvenskoordinater.

Kända attackvektorer

  • Heltalsspill i 32-bitars sekvensindexerare (FAI) som överstiger 2^31 baspar.
  • Buffertspill vid läsning av alltför långa huvuden för sekvensidentifierare.
  • Tjänstenekad (DoS) genom patologiska inriktningsfrågor.

Rekommenderade skyddsåtgärder:

Historiskt ursprung och milstolpar

2003Human Genome Project slutför den första sekvenseringen av det humana genomet och publicerar resultaten i FASTA-format.
1990BLAST (Basic Local Alignment Search Tool) antar FASTA som standardinmatningsformat.
1985William Pearson och David Lipman introducerar FASTA med programvaran för sekvensinriktning FASTP.

Viktiga fördelar

  • Den ohotade globala standarden för beräkningsbiologi: används av alla genomiska verktyg, sekvenserare och databaser på jorden.
  • Extrem enkelhet: rad 1 börjar med '>' följt av ett ID, följt av genetiska bokstäver i ren text.
  • Kapacitet för flera sekvenser: en enda fil kan innehålla tusentals enskilda gener eller fullständiga virusgenom.

Tekniska begränsningar

  • Innehåller inga sekvenseringskvalitetspoäng (till skillnad från FASTQ, som lagrar Phred-förtroendepoäng per bas).
  • Ingen standardiserad metadatasyntax för huvudrader utöver den ursprungliga identifieraren.
  • Enormt lagringsutrymme för helgenomdatauppsättningar utan Gzip eller specialiserad genomisk komprimering.

Intressant teknisk kuriosa

  • Hela det mänskliga genomet på 3 miljarder baspar kan representeras i FASTA-format och tar ungefär 3 gigabyte lagringsutrymme.
  • De fyra DNA-bokstäverna som lagras i FASTA-filer är A (Adenin), C (Cytosin), G (Guanin) och T (Tymin).
  • När covid-19-coronavirusets genom sekvenserades för första gången i januari 2020 delade forskare det globalt som en 30 000 bokstäver lång FASTA-fil.

Vanliga tekniska frågor

Vad är en FASTA-fil?

En FASTA-fil är en ren textfil som används inom biologi för att lagra DNA-, RNA- eller proteinsekvenser med enbokstavsförkortningar.

Vad är skillnaden mellan FASTA och FASTQ?

FASTA lagrar enbart de genetiska sekvensbokstäverna, medan FASTQ lagrar både bokstäverna och en kvalitetspoäng för sekvenseringsnoggrannheten för varje bas.

Hur kan jag visa en FASTA-fil?

Du kan öppna FASTA-filer i vilken textredigerare som helst, visa dem i bioinformatikprogram som Jalview eller UGENE, eller konvertera dem med File2File.app.