FASTA-sekvens (.fasta)
Bioinformatics StandardFASTA er det uunnværlige grunnfilformatet innen bioinformatikk og genomikk, som representerer nukleotidsekvenser (DNA, RNA) og aminosyre-proteinsekvenser ved hjelp av universelle enkeltbokstavskoder.
Konverter FASTA til GENBANK
Gratis FASTA til GENBANK-konverterer i nettleseren. Konverter filer umiddelbart på enheten din.
Undersøk og metadata
Operativsystemer og filanalysatorer identifiserer FASTA-filer ved å undersøke den innledende binære bytesekvensen:
Byte-nivå hodesignatur (Magic Bytes)
Operativsystemer og filanalysatorer identifiserer FASTA-filer ved å undersøke den innledende binære bytesekvensen:
HEX-SIGNATUR (OFFSET 0):
3EASCII-REPRESENTASJON: >
Standardisering: Bioinformatics de facto global standard
Tekniske spesifikasjoner
| Beholderarkitektur | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Komprimering | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Bytterekkefølge | ASCII / UTF-8 text stream |
| Fargerom | N/A (Genomic Sequence Data) |
| Kanaler og struktur | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maks. dimensjoner | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Gjennomsiktighet | None |
| Strømming og progressiv | Sequential record-by-record streaming processing |
Teknisk sammenligningsmatrise: FASTA vs konkurrenter
| Teknisk attributt | FASTA (Gjeldende) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kvalitetsskårer | Ingen (rene sekvensbokstaver) | Phred-kvalitetsskårer per base | Ingen (funksjonsannoteringer) | Ingen (funksjonskoordinater) |
| Overskriftslinje | Starter med tegnet '>' | Starter med tegnet '@' | Strukturert LOCUS-blokk | Tabulatorseparerte genomiske kolonner |
| Primær bruk | Referansegenomer og BLAST-søk | Rådata fra høykapasitetssekvensere (Illumina) | Omfattende annoterte gener | Genomiske funksjonsannoteringer |
| Filstørrelse (Menneske) | ~3 Gigabyte ukomprimert | ~100+ Gigabyte (med kvaliteter) | Flergigabytes rik tekst | ~50 Megabyte |
Vanlige korrupsjonsmoduser og heksadesimal gjenopprettingsveiledning
Bioinformatikkverktøy rapporterer «Invalid sequence character at line X».
Underliggende årsak: Mellomrom, tall eller ikke-IUPAC-tegn inne i sekvenslinjene.
Utbedring: Filtrer og rengjør sekvenstegn ved hjelp av File2File Bioinformatics Tool.
Sikkerhetsanalyse og parser-angrepsvektorer
Genomikkverktøy analyserer massive FASTA-filer på flere gigabyte der heltallsoverflyt (integer overflow) kan oppstå ved indeksering av sekvenskoordinater.
Kjente angrepsvektorer
- Heltallsoverflyt i 32-bits sekvensindekserere (FAI) som overstiger 2^31 basepar.
- Bufferoverflyt ved lesing av overdrevent lange identifikatorhoder for sekvenser.
- Tjenestenekt (Denial of Service) gjennom patologiske tilpasningsspørringer.
Beste praksis for forsvar:
Historisk opprinnelse og milepæler
Viktige fordeler
- Det ubestridte globale standardformatet innen beregningsbiologi: brukes av hvert eneste genomiske verktøy, sekvenseringsapparat og database på jorden.
- Ekstrem enkelhet: linje 1 starter med '>' etterfulgt av en ID, etterfulgt av vanlijke genetiske tekstbokstaver.
- Kapasitet for flere sekvenser: en enkelt fil kan inneholde tusenvis av individuelle gener eller komplette virusgenomer.
Tekniske begrensninger og ulemper
- Inneholder ingen sekvenseringskvalitetsskårer (i motsetning til FASTQ, som lagrer Phred-konfidensskårer per base).
- Ingen standardisert metadatasyntaks for overskriftslinjer utover den opprinnelige identifikatoren.
- Enormt lagringsbehov for helgenomdatasett uten Gzip eller spesialisert genomisk komprimering.
Interessante tekniske fakta
- Hele det menneskelige genomet på 3 milliarder basepar kan representeres i FASTA-format, som tar omtrent 3 gigabyte med lagringsplass.
- De fire DNA-bokstavene som lagres i FASTA-filer, er A (Adenin), C (Cytosin), G (Guanin) og T (Thymin).
- Da covid-19-koronavirusgenomet ble sekvensert for første gang i januar 2020, delte forskere det globalt som en FASTA-fil på 30 000 bokstaver.
Ofte stilte tekniske spørsmål
Hva er en FASTA-fil?
En FASTA-fil er en ren tekstfil som brukes i biologien til å lagre DNA-, RNA- eller proteinsekvenser ved hjelp av enkeltbokstavforkortelser.
Hva er forskjellen mellom FASTA og FASTQ?
FASTA lagrer bare de genetiske sekvensbokstavene, mens FASTQ lagrer både bokstavene og en nøyaktighets- eller kvalitetsscore for sekvenseringen for hver base.
Hvordan kan jeg se på en FASTA-fil?
Du kan åpne FASTA-filer i en hvilken som helst tekstredigerer, se dem i bioinformatikkprogramvare som Jalview eller UGENE, eller konvertere dem ved hjelp av File2File.app.
Relaterte konverteringspar for FASTA
Konvertering av en enkel FASTA-sekvens til en GenBank-flatfil legger til essensielle biologiske annoteringer og metadata til den rå genetiske koden.
Konvertering av en GenBank-flatfil til en FASTA-sekvens fjerner annoteringsmetadata for å etterlate kun de rå nukleotid- eller aminosyresekvensene som trengs for rask bioinformatisk analyse.