FASTA-sekvens (.fasta)
Bioinformatics StandardFASTA er det allestedsnærværende, fundamentale filformat inden for bioinformatik og genomik, der repræsenterer nukleotidsekvenser (DNA, RNA) og aminosyre-proteinsekvenser ved hjælp af universelle enkeltbogstavskoder.
Konverter FASTA til GENBANK
Gratis FASTA til GENBANK-konverter i browseren. Konverter filer med det samme på din enhed.
Undersøg & Metadata
Operativsystemer og filanalysatorer identificerer FASTA-filer ved at inspicere den indledende binære bytesekvens:
Byte-niveau Header-signatur (Magic Bytes)
Operativsystemer og filanalysatorer identificerer FASTA-filer ved at inspicere den indledende binære bytesekvens:
HEX-SIGNATUR (OFFSET 0):
3EASCII-REPRÆSENTATION: >
Standardisering: Bioinformatics de facto global standard
Tekniske specifikationer
| Containerarkitektur | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Komprimering | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Bytterejsning | ASCII / UTF-8 text stream |
| Farverum | N/A (Genomic Sequence Data) |
| Kanaler og struktur | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maks. dimensioner | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Gennemsigtighed | None |
| Streaming og progressiv | Sequential record-by-record streaming processing |
Tekniske sammenligningsmatrix: FASTA vs. konkurrenter
| Teknisk attribut | FASTA (Aktuel) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kvalitetsscorer | Ingen (rene sekvensbogstaver) | Phred-kvalitetsscorer pr. base | Ingen (egenskabsannotationer) | Ingen (egenskabskoordinater) |
| Headerlinje | Starter med tegnet '>' | Starter med tegnet '@' | Struktureret LOCUS-blok | Tabulatorseparerede genomiske kolonner |
| Primær anvendelse | Referencegenomer og BLAST-søgning | Rå high-throughput-sekventeringsapparater (Illumina) | Omfattende annoterede gener | Genomiske egenskabsannotationer |
| Filstørrelse (Humane) | ~3 gigabyte ukomprimeret | ~100+ gigabyte (med kvaliteter) | Rig tekst på flere gigabyte | ~50 megabyte |
Almindelige korruptionstilstande og hex-gendannelsesvejledning
Bioinformatikværktøj rapporterer 'Ugyldigt sekvenstegn på linje X'.
Grundlæggende årsag: Hvide mellemrum, tal eller ikke-IUPAC-tegn inde i sekvenslinjerne.
Gendannelse: Filtrer og rens sekvenstegn ved hjælp af File2File Bioinformatics Tool.
Sikkerhedsanalyse og parser-angrebsvektorer
Genomikværktøjer parser massive multi-gigabyte FASTA-filer, hvor heltals-overløb kan forekomme ved indeksering af sekvenskoordinater.
Kendte angrebsvektorer
- Heltalsoverløb i 32-bit sekvensindekserere (FAI) der overstiger 2^31 basepar.
- Bufferoverløb ved læsning af overdrevne lange sekvensidentifikationsheaders.
- Nægtelse af tjeneste gennem patologiske justeringsforespørgsler.
Defensive bedste praksisser:
Historisk oprindelse og milepæle
Vigtige fordele og styrker
- Den ubestridte globale standard for beregningsmæssig biologi: bruges af ethvert genomisk værktøj, sekventeringsapparat og database på Jorden.
- Ekstrem enkelheid: linje 1 starter med '>' efterfulgt af et ID, efterfulgt af genetiske bogstaver i almindelig tekst.
- Kapacitet til flere sekvenser: En enkelt fil kan indeholde tusindvis af individuelle gener eller komplette virale genomer.
Tekniske begrænsninger og ulemper
- Indeholder ingen sekventeringskvalitetsscorer (i modsætning til FASTQ, som gemmer Phred-tillidsscorer pr. base).
- Ingen standardiseret metadatasynaks for headerlinjer ud over den første identifikator.
- Enormt lagringsfodaftryk for hele genom-datasæt uden Gzip eller specialiseret genomisk komprimering.
Interessant teknisk trivia
- Det hele 3 milliarder basepar lange humane genom kan repræsenteres i FASTA-format og tager ca. 3 gigabyte lagerplads.
- De fire bogstaver i DNA, der er gemt i FASTA-filer, er A (Adenin), C (Cytosin), G (Guanin) og T (Thymin).
- Da COVID-19-coronavirusgenomet først blev sekventeret i januar 2020, delte forskere det globalt som en 30.000 bogstaver lang FASTA-fil.
Ofte stillede tekniske spørgsmål
Hvad er en FASTA-fil?
En FASTA-fil er en almindelig tekstfil, der bruges inden for biologien til at gemme DNA-, RNA- eller proteinsekvenser ved hjælp af enkeltbogstavsforkortelser.
Hvad er forskellen mellem FASTA og FASTQ?
FASTA gemmer kun de genetiske sekvensbogstaver, hvorimod FASTQ gemmer både bogstaverne og en kvalitetsscore for sekventeringsnøjagtigheden for hver base.
Hvordan kan jeg se en FASTA-fil?
Du kan åbne FASTA-filer i enhver teksteditor, se dem i bioinformatiksoftware som Jalview eller UGENE eller konvertere dem ved hjælp af File2File.app.
Relaterede FASTA konverteringspar
Konvertering af en simpel FASTA-sekvens til en GenBank-flatfile tilføjer væsentlige biologiske annotationer og metadata til rå genetisk kode.
Konvertering af en GenBank-flatfile til en FASTA-sekvens fjerner annoteringsmetadata for udelukkende at bevare de rå nukleotid- eller aminosyresekvenser, der er nødvendige til hurtig bioinformatisk analyse.