FASTA sekvencia (.fasta)

Bioinformatics Štandard

FASTA je všadeprítomný, základný súborový formát bioinformatiky a genomiky, ktorý reprezentuje nukleotidové sekvencie (DNA, RNA) a aminokyselinové proteínové sekvencie pomocou univerzálnych jednopísmenových kódov.

Konvertovať FASTA do GENBANK

Bezplatný konvertor z FASTA do GENBANK priamo v prehliadači. Konvertujte súbory okamžite vo svojom zariadení.

Preskúmať a metadáta

Operačné systémy a analyzátory súborov identifikujú súbory FASTA kontrolou počiatočnej binárnej bajtovej sekvencie:

Vyberte alebo presuňte súbory sem

100 % súkromná konverzia v prehliadači - súbory nikdy neopustia vaše zariadenie

alebo prilepiť Ctrl+V
Záruka súkromia s nulovým prenosom do siete: 0 bajtov odovzdaných na externé servery. Všetko spracovanie prebehlo lokálne v pieskovisku vášho prehliadača.

Podpis hlavičky na úrovni bajtov (Magic Bytes)

Operačné systémy a analyzátory súborov identifikujú súbory FASTA kontrolou počiatočnej binárnej bajtovej sekvencie:

HEXADECIMÁLNY PODPIS (OFFSET 0):

3E

ASCII REPREZENTÁCIA: >

Štandardizácia: Bioinformatics de facto global standard

Technické špecifikácie

Architektúra kontajneraPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompresiaUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Poradie bajtov (Endianness)ASCII / UTF-8 text stream
Farebné priestoryN/A (Genomic Sequence Data)
Kanály a štruktúraNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Max. rozmeryUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
PriehľadnosťNone
Streamovanie a postupné načítavanieSequential record-by-record streaming processing

Technická porovnávacia matica: FASTA vs konkurenti

Technický atribútFASTA (Aktuálne)FASTQGENBANKGFF
Skóre kvalityŽiadne (čisté písmená sekvencie)Phredove skóre kvality pre každú bázuŽiadne (anotácie prvkov)Žiadne (súradnice prvkov)
Riadok hlavičkyZačína znakom '>'Začína znakom '@'Štruktúrovaný blok LOCUSGenomické stĺpce oddelené tabulátorom
Hlavné použitieReferenčné genómy & vyhľadávanie BLASTSurové vysokokapacitné sekvenátory (Illumina)Komplexné anotované gényAnotácie genomických prvkov
Velkosť súboru (ľudský)~3 gigabajty nekomprimované~100+ gigabajtov (s kvalitami)Bohatý text s veľkosťou niekoľkých gigabajtov~50 megabajtov

Bežné režimy poškodenia a príručka na obnovu v hexadecimálnom kóde

Bioinformatický nástroj hlási 'Neplatný znak sekvencie na riadku X'.

Hlavná príčina: Medzery, čísla alebo znaky mimo štandardu IUPAC vnútri riadkov sekvencie.

Obnova: Filtrujte a vyčistite znaky sekvencie pomocou nástroja File2File Bioinformatics Tool.

Bezpečnostná analýza a vektory útokov na parser

Genomické nástroje parsujú masívne niekoľkogigabajtové súbory FASTA, kde pri indexovaní súradníc sekvencií môže dôjsť k pretečeniu celých čísel.

Známe vektory útokov

  • Pretečenie celého čísla (integer overflow) v 32-bitových indexeroch sekvencií (FAI) presahujúcich 2^31 párov báz.
  • Pretečenie vyrovnávacej pamäte pri čítaní nadmerne dlhých hlavičiek identifikátorov sekvencií.
  • Odopretie služby prostredníctvom patologických dopytov zarovnania.

Najlepšie obranné postupy:

Historický pôvod a míľniky

2003Projekt ľudského genómu dokončuje prvé sekvenovanie ľudského genómu a publikuje výsledky vo formáte FASTA.
1990Nástroj BLAST (Basic Local Alignment Search Tool) prijíma formát FASTA ako svoj štandardný vstupný formát.
1985William Pearson a David Lipman zavádzajú formát FASTA spolu so softvérom na porovnávanie sekvencií FASTP.

Kľúčové výhody a prednosti

  • Nespochybniteľný globálny štandard výpočtovej biológie: používaný každým genomickým nástrojom, sekvenátorom a databázou na Zemi.
  • Extrémna jednoduchosť: 1. riadok začína znakom '>' nasledovaným ID, po ktorom nasledujú genetické písmená v čistom texte.
  • Kapacita pre viaceré sekvencie: jediný súbor môže obsahovať tisíce jednotlivých génov alebo kompletné vírusové genómy.

Technické obmedzenia a nevýhody

  • Neobsahuje skóre kvality sekvenovania (na rozdiel od formátu FASTQ, ktorý ukladá Phredove miery spoľahlivosti pre bázu).
  • Žiadna štandardizovaná syntax metadát pre riadky hlavičky okrem počiatočného identifikátora.
  • Obrovská úložná stopa pre celogenómové dátové sady bez kompresie Gzip alebo špecializovanej genomickej kompresie.

Zaujímavé technické drobnosti

  • Celý ľudský genóm s 3 miliardami párov báz môže byť reprezentovaný vo formáte FASTA, pričom zaberá približne 3 gigabajty úložného priestoru.
  • Štyri písmená DNA uložené v súboroch FASTA sú A (adenín), C (citozín), G (guanín) a T (tymín).
  • Keď bol genóm koronavírusu COVID-19 prvýkrát sekvenovaný v januári 2020, vedci ho celosvetovo zdieľali ako 30 000-písmenový súbor FASTA.

Často kladené technické otázky

Čo je to súbor FASTA?

Súbor FASTA je obyčajný textový súbor používaný v biológii na ukladanie sekvencií DNA, RNA alebo proteínov pomocou jednopísmenových skratiek.

Aký je rozdiel medzi formátmi FASTA a FASTQ?

FASTA uchováva iba písmená genetickej sekvencie, zatiaľ čo FASTQ uchováva pre každú bázu aj písmená spolu so skóre presnosti a kvality sekvenovania.

Ako môžem zobraziť súbor FASTA?

Súbory FASTA môžete otvoriť v ľubovoľnom textovom编辑ore, zobraziť ich v bioinformatickom softvéri ako Jalview či UGENE, prípadne ich skonvertovať pomocou File2File.app.