FASTA sekvenca (.fasta)

Bioinformatics Standardno

FASTA je posvuda prisutan, temeljni format datoteke u bioinformatici i genomici, koji predstavlja nukleotidne sekvence (DNA, RNA) i aminokiselinske proteinske sekvence koristeći univerzalne jednokratne kodove s jednim slovom.

Pretvori FASTA u GENBANK

Besplatni FASTA u GENBANK pretvarač u pregledniku. Trenutno pretvorite datoteke na svom uređaju.

Pregledaj i metapodaci

Operativni sustavi i alati za analizu datoteka identificiraju FASTA datoteke provjerom početnog niza binarnih bajtova:

Odaberite ili ispustite datoteke ovdje

100% privatna pretvorba u pregledniku - datoteke nikada ne napuštaju vaš uređaj

ili zalijepi Ctrl+V
Jamstvo privatnosti nulte mrežne transmisije: 0 bajtova učitano na vanjske poslužitelje. Sva obrada odvijala se lokalno u sandčiću vašeg preglednika.

Potpis zaglavlja na razini bajtova (Magic Bytes)

Operativni sustavi i alati za analizu datoteka identificiraju FASTA datoteke provjerom početnog niza binarnih bajtova:

HEX POTPIS (POMAK 0):

3E

ASCII PRIKAZ: >

Standardizacija: Bioinformatics de facto global standard

Tehničke specifikacije

Arhitektura spremnikaPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompresijaUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
字节序ASCII / UTF-8 text stream
Prostori bojaN/A (Genomic Sequence Data)
Kanali i strukturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maksimalne dimenzijeUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ProzirnostNone
Streaming i progresivnoSequential record-by-record streaming processing

Tehnička matrica usporedbe: FASTA vs Konkurencija

Tehnički atributFASTA (Trenutno)FASTQGENBANKGFF
Rezultati kvaliteteNema (čista slova sekvence)Phred ocjene kvalitete po baziNema (oznake značajki)Nema (koordinate značajki)
Redak zaglavljaZapočinje znakom '>'Započinje znakom '@'Strukturirani LOCUS blokGenomski stupci odvojeni tabulatorom
Primarna upotrebaReferentni genomi i BLAST pretragaSirovi visokopropusni sekvencatori (Illumina)Sveobuhvatni anotirani geniAnotacije genomskih značajki
Veličina datoteke (Ljudski)~3 gigabajta nekomprimirano~100+ gigabajta (s kvalitetama)Višegigabajtni obogaćeni tekst~50 megabajta

Uobičajeni načini oštećenja i vodič za heksadecimalni oporavak

Bioinformatički alat javlja 'Nevažeći znak sekvence u retku X'.

Temeljni uzrok: Bjeline, brojevi ili znakovi koji nisu IUPAC unutar redaka sekvence.

Oporavak: Filtrirajte i očistite znakove sekvence pomoću File2File alata za bioinformatiku.

Sigurnosna analiza i vektori napada na parser

Genomski alati analiziraju masivne višegigabajtne FASTA datoteke gdje može doći do prelijevanja cijelih brojeva (integer overflow) pri indeksiranju koordinata sekvence.

Poznati vektori napada

  • Prelijevanje cijelih brojeva u 32-bitnim indekserima sekvenci (FAI) koji premašuju 2^31 baznih parova.
  • Prelijevanje međuspremnika (buffer overflow) pri čitanju pretjerano dugih zaglavlja identifikatora sekvence.
  • Uskaćivanje usluge (DoS) kroz patološke upite za poravnanje.

Najbolje obrambene prakse:

Povijesni izvori i prekretnice

2003Projekt ljudskog genoma dovršava prvo sekvenciranje ljudskog genoma, objavljujući rezultate u FASTA formatu.
1990BLAST (Basic Local Alignment Search Tool) prihvaća FASTA kao svoj standardni ulazni format.
1985William Pearson i David Lipman predstavljaju FASTA format s programom za poravnanje sekvenci FASTP.

Ključne prednosti

  • Neprikosnoveni globalni standard računalne biologije: koriste ga svi genomski alati, sekvencatori i baze podataka na Zemlji.
  • Iznimna jednostavnost: 1. red započinje s '>' praćen identifikatorom, a zatim običnim tekstom genetskih slova.
  • Kapacitet za više sekvenci: jedna datoteka može sadržavati tisuće pojedinačnih gena ili potpune virusne genome.

Tehnička ograničenja i nedostaci

  • Ne sadrži rezultate kvalitete sekvenciranja (za razliku od FASTQ-a, koji pohranjuje Phred ocjene pouzdanosti po bazi).
  • Nema standardizirane sintakse metapodataka za zaglavlja osim početnog identifikatora.
  • Ogroman otisak pohrane za skupove podataka cijelog genoma bez Gzipa ili specijalizirane genomske kompresije.

Zanimljive tehničke činjenice

  • Cijeli ljudski genom s 3 milijarde baznih parova može se prikazati u FASTA formatu, zauzimajući otprilike 3 gigabajta pohrane.
  • Četiri slova DNA pohranjena u FASTA datotekama su A (Adenin), C (Citozin), G (Guanin) i T (Timin).
  • Kada je genom koronavirusa COVID-19 prvi put sekvenciran u siječnju 2020., znanstvenici su ga globalno podijelili kao FASTA datoteku s 30 000 slova.

Često postavljana tehnička pitanja

Što je FASTA datoteku?

FASTA datoteka je obična tekstualna datoteka koja se koristi u biologiji za pohranu DNK, RNA ili proteinskih sekvenci pomoću jednoslovnih kratica.

Koja je razlika između FASTA i FASTQ format?

FASTA pohranjuje samo slova genetske sekvence, dok FASTQ pohranjuje i slova i ocjenu točnosti sekvenciranja za svaku bazu.

Kako mogu pregledati FASTA datoteku?

FASTA datoteke možete otvoriti u bilo kojem uređivaču teksta, pregledati ih u računalno-biološkom softveru poput Jalview ili UGENE ili ih pretvoriti pomoću File2File.app.