FASTA sekvencia (.fasta)
Bioinformatics ŠtandardFASTA je všadeprítomný, základný súborový formát bioinformatiky a genomiky, ktorý reprezentuje nukleotidové sekvencie (DNA, RNA) a aminokyselinové proteínové sekvencie pomocou univerzálnych jednopísmenových kódov.
Konvertovať FASTA do GENBANK
Bezplatný konvertor z FASTA do GENBANK priamo v prehliadači. Konvertujte súbory okamžite vo svojom zariadení.
Preskúmať a metadáta
Operačné systémy a analyzátory súborov identifikujú súbory FASTA kontrolou počiatočnej binárnej bajtovej sekvencie:
Podpis hlavičky na úrovni bajtov (Magic Bytes)
Operačné systémy a analyzátory súborov identifikujú súbory FASTA kontrolou počiatočnej binárnej bajtovej sekvencie:
HEXADECIMÁLNY PODPIS (OFFSET 0):
3EASCII REPREZENTÁCIA: >
Štandardizácia: Bioinformatics de facto global standard
Technické špecifikácie
| Architektúra kontajnera | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Kompresia | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Poradie bajtov (Endianness) | ASCII / UTF-8 text stream |
| Farebné priestory | N/A (Genomic Sequence Data) |
| Kanály a štruktúra | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Max. rozmery | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Priehľadnosť | None |
| Streamovanie a postupné načítavanie | Sequential record-by-record streaming processing |
Technická porovnávacia matica: FASTA vs konkurenti
| Technický atribút | FASTA (Aktuálne) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Skóre kvality | Žiadne (čisté písmená sekvencie) | Phredove skóre kvality pre každú bázu | Žiadne (anotácie prvkov) | Žiadne (súradnice prvkov) |
| Riadok hlavičky | Začína znakom '>' | Začína znakom '@' | Štruktúrovaný blok LOCUS | Genomické stĺpce oddelené tabulátorom |
| Hlavné použitie | Referenčné genómy & vyhľadávanie BLAST | Surové vysokokapacitné sekvenátory (Illumina) | Komplexné anotované gény | Anotácie genomických prvkov |
| Velkosť súboru (ľudský) | ~3 gigabajty nekomprimované | ~100+ gigabajtov (s kvalitami) | Bohatý text s veľkosťou niekoľkých gigabajtov | ~50 megabajtov |
Bežné režimy poškodenia a príručka na obnovu v hexadecimálnom kóde
Bioinformatický nástroj hlási 'Neplatný znak sekvencie na riadku X'.
Hlavná príčina: Medzery, čísla alebo znaky mimo štandardu IUPAC vnútri riadkov sekvencie.
Obnova: Filtrujte a vyčistite znaky sekvencie pomocou nástroja File2File Bioinformatics Tool.
Bezpečnostná analýza a vektory útokov na parser
Genomické nástroje parsujú masívne niekoľkogigabajtové súbory FASTA, kde pri indexovaní súradníc sekvencií môže dôjsť k pretečeniu celých čísel.
Známe vektory útokov
- Pretečenie celého čísla (integer overflow) v 32-bitových indexeroch sekvencií (FAI) presahujúcich 2^31 párov báz.
- Pretečenie vyrovnávacej pamäte pri čítaní nadmerne dlhých hlavičiek identifikátorov sekvencií.
- Odopretie služby prostredníctvom patologických dopytov zarovnania.
Najlepšie obranné postupy:
Historický pôvod a míľniky
Kľúčové výhody a prednosti
- Nespochybniteľný globálny štandard výpočtovej biológie: používaný každým genomickým nástrojom, sekvenátorom a databázou na Zemi.
- Extrémna jednoduchosť: 1. riadok začína znakom '>' nasledovaným ID, po ktorom nasledujú genetické písmená v čistom texte.
- Kapacita pre viaceré sekvencie: jediný súbor môže obsahovať tisíce jednotlivých génov alebo kompletné vírusové genómy.
Technické obmedzenia a nevýhody
- Neobsahuje skóre kvality sekvenovania (na rozdiel od formátu FASTQ, ktorý ukladá Phredove miery spoľahlivosti pre bázu).
- Žiadna štandardizovaná syntax metadát pre riadky hlavičky okrem počiatočného identifikátora.
- Obrovská úložná stopa pre celogenómové dátové sady bez kompresie Gzip alebo špecializovanej genomickej kompresie.
Zaujímavé technické drobnosti
- Celý ľudský genóm s 3 miliardami párov báz môže byť reprezentovaný vo formáte FASTA, pričom zaberá približne 3 gigabajty úložného priestoru.
- Štyri písmená DNA uložené v súboroch FASTA sú A (adenín), C (citozín), G (guanín) a T (tymín).
- Keď bol genóm koronavírusu COVID-19 prvýkrát sekvenovaný v januári 2020, vedci ho celosvetovo zdieľali ako 30 000-písmenový súbor FASTA.
Často kladené technické otázky
Čo je to súbor FASTA?
Súbor FASTA je obyčajný textový súbor používaný v biológii na ukladanie sekvencií DNA, RNA alebo proteínov pomocou jednopísmenových skratiek.
Aký je rozdiel medzi formátmi FASTA a FASTQ?
FASTA uchováva iba písmená genetickej sekvencie, zatiaľ čo FASTQ uchováva pre každú bázu aj písmená spolu so skóre presnosti a kvality sekvenovania.
Ako môžem zobraziť súbor FASTA?
Súbory FASTA môžete otvoriť v ľubovoľnom textovom编辑ore, zobraziť ich v bioinformatickom softvéri ako Jalview či UGENE, prípadne ich skonvertovať pomocou File2File.app.
Súvisiace konverzné páry pre FASTA
Konverzia obyčajnej sekvencie FASTA na súbor GenBank pridáva k surovému genetickému kódu dôležité biologické anotácie a metadátové záznamy.
Konverzia GenBank súboru na FASTA sekvenciu odstráni metadátové anotácie a ponechá iba surové nukleotidové alebo aminokyselinové sekvencie potrebné na rýchlu bioinformatickú analýzu.