FASTA sekvenca (.fasta)

Bioinformatics Standardno

FASTA je svuda prisutan, osnovni format datoteke u bioinformatici i genomici, koji predstavlja nukleotidne sekvence (DNA, RNA) i aminokiselinske proteinske sekvence koristeći univerzalne jednoslovne kodove.

Конвертујте FASTA у GENBANK

Бесплатан FASTA у GENBANK конвертор у прегледачу. Конвертујте фајлове тренутно без слања на сервер уз 100% приватност.

Pregledaj i metapodaci

Operativni sistemi i analizatori datoteka identifikuju FASTA datoteke proverom početnog binarnog niza bajtova:

Изаберите или превуците датотеке овде

100% приватна конверзија у прегледачу – датотеке никада не напуштају ваш уређај

или налепите Ctrl+V
100% Локална обрада у прегледачу 0 бајтова послато спољним серверима. Сва обрада је извршена локално у безбедном окружењу вашег прегледача.

Potpis zaglavlja na nivou bajtova (Magic Bytes)

Operativni sistemi i analizatori datoteka identifikuju FASTA datoteke proverom početnog binarnog niza bajtova:

HEX POTPIS (OFFSET 0):

3E

ASCII REPREZENTACIJA: >

Standardizacija: Bioinformatics de facto global standard

Tehničke specifikacije

Arhitektura kontejneraPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompresijaUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Bajtni redosled (Endianness)ASCII / UTF-8 text stream
Prostori bojaN/A (Genomic Sequence Data)
Kanali i strukturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maksimalne dimenzijeUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
TransparentnostNone
Strimovanje i progresivno učitavanjeSequential record-by-record streaming processing

Tehnička matrica poređenja: FASTA vs Konkurenti

Tehnički atributFASTA (Trenutno)FASTQGENBANKGFF
Ocene kvalitetaNema (čista slova sekvence)Phred ocene kvaliteta po baziNema (anotacije funkcija)Nema (koordinate funkcija)
Linija zaglavljaPočinje sa znakom '>'Počinje sa znakom '@'Struktuirani LOCUS blokGenomske kolone razdvojene tabulatorima
Primarna upotrebaReferentni genomi i BLAST pretragaSirovi sekvenceri visoke propusnosti (Illumina)Sveobuhvatni anotirani geniAnotacije genomskih funkcija
Veličina datoteke (ljudska)~3 gigabajta nesiromašeno / nekompresovano~100+ gigabajta (sa kvalitetima)Bogati tekst od više gigabajta~50 megabajta

Uobičajeni režimi oštećenja i vodič za heksadecimalni oporavak

Bioinformatički alat prijavljuje grešku 'Invalid sequence character at line X'.

Osnovni uzrok: Razmaci, brojevi ili ne-IUPAC znakovi unutar linija sekvence.

Oporavak: Filtrirajte i očistite znakove sekvence pomoću alata File2File Bioinformatics Tool.

Bezbednosna analiza i vektori napada parsera

Genomski alati parsiraju masivne FASTA datoteke od više gigabajta gde može doći do prekoračenja celobrojnih vrednosti (integer overflow) pri indeksiranju koordinata sekvence.

Poznati vektori napada

  • Prekoračenje celobrojnih vrednosti u 32-bitnim indekserima sekvenci (FAI) koji prelaze 2^31 baznih parova.
  • Prekoračenje bafera pri čitanju predugačkih zaglavlja identifikatora sekvenci.
  • Uskraćivanje usluge (DoS) kroz patološke upite za usklađivanje.

Defanzivne najbolje prakse:

Istorijat i prekretnice

2003Projekat ljudskog genoma završava prvo sekvenciranje ljudskog genoma, objavljujući rezultate u FASTA formatu.
1990BLAST (Basic Local Alignment Search Tool) usvaja FASTA kao svoj standardni ulazni format.
1985William Pearson i David Lipman uvode FASTA sa softverom za usklađivanje sekvenci FASTP.

Ključne prednosti

  • Neprikosnoveni globalni standard kompjuterske biologije: koristi ga svaki genomski alat, sekvencator i baza podataka na Zemlji.
  • Ekstremna jednostavnost: 1. linija počinje sa '>' nakon čega sledi ID, a zatim običan tekst genetskih slova.
  • Kapacitet za više sekvenci: jedna datoteka može sadržati hiljade pojedinačnih gena ili kompletne viralne genome.

Tehnička ograničenja i nedostaci

  • Ne sadrži ocene kvaliteta sekvenciranja (za razliku od FASTQ-a, koji čuva Phred ocene pouzdanosti po bazi).
  • Nema standardizovanu sintaksu metapodataka za linije zaglavlja osim početnog identifikatora.
  • Ogroman otisak skladištenja za skupove podataka celog genoma bez Gzip-a ili specijalizovane genomske kompresije.

Zanimljivosti

  • Ceo ljudski genom od 3 milijarde baznih parova može se predstaviti u FASTA formatu, zauzimajući otprilike 3 gigabajta prostora za skladištenje.
  • Četiri slova DNK uskladištena u FASTA datotekama su A (Adenin), C (Citozin), G (Guanin) i T (Timin).
  • Kada je genom koronavirusa COVID-19 prvi put sekvenciran u januaru 2020. godine, naučnici su ga podelili širom sveta kao FASTA datoteku od 30.000 slova.

Često postavljana tehnička pitanja

Šta je FASTA fajl?

FASTA fajl je običan tekstualni fajl koji se koristi u biologiji za skladištenje DNK, RNK ili proteinskih sekvenci koristeći jednoslovne skraćenice.

Koja je razlika između FASTA i FASTQ formata?

FASTA čuva samo slova genetskih sekvenci, dok FASTQ čuva i slova i ocenu tačnosti sekvenciranja za svaku bazu.

Kako mogu da pregledam FASTA fajl?

Možete otvoriti FASTA fajlove u bilo kom uređivaču teksta, pregledati ih u bioinformatičkom softveru kao što su Jalview ili UGENE, ili ih konvertovati pomoću File2File.app.