FASTA szekvencia (.fasta)

Bioinformatics Szabvány

A FASTA a bioinformatika és a genomika mindenütt jelen lévő, alapvető fájlformátuma, amely nukleotid-szekvenciákat (DNS, RNS) és aminosav-fehérjeszekvenciákat ábrázol univerzális egyliteres kódok használatával.

FASTA konvertálása erre: GENBANK

Ingyenes, böngészőn belüli FASTA - GENBANK konvertáló. Konvertáljon fájlokat azonnal az eszközén.

Vizsgálat és metaadatok

Az operációs rendszerek és a fájlelemzők a kezdő bináris bájtsorozat vizsgálatával azonosítják a(z) FASTA fájlokat:

Válasszon ki vagy ejtsen ide fájlokat

100%-ban magánjellegű, böngészőn belüli konvertálás - a fájlok soha nem hagyják el az eszközét

vagy beillesztés Ctrl+V
Nulla hálózati adatátviteli adatvédelmi garancia: 0 bájt lett feltöltve külső szerverekre. Minden feldolgozás helyben, az Ön böngészőjének homokozójában történt.

Bájt-szintű fejléc aláírás (Magic Bytes)

Az operációs rendszerek és a fájlelemzők a kezdő bináris bájtsorozat vizsgálatával azonosítják a(z) FASTA fájlokat:

HEX ALÁÍRÁS (ELTOLÁS 0):

3E

ASCII REPREZENTÁCIÓ: >

Szabványosítás: Bioinformatics de facto global standard

Műszaki specifikációk

Konténer architektúraPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
TömörítésUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
BájtsorrendASCII / UTF-8 text stream
SzínterekN/A (Genomic Sequence Data)
Csatornák és struktúraNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Max. méretekUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ÁtlátszóságNone
Streaming és progresszívSequential record-by-record streaming processing

Műszaki összehasonlító mátrix: FASTA vs Versenytársak

Technikai attribútumFASTA (Jelenlegi)FASTQGENBANKGFF
Minőségi pontszámokNincs (tiszta szekvenciabetűk)Bázisonkénti Phred minőségi pontszámokNincs (funkcióannotációk)Nincs (funkciókoordináták)
Fejlécsor'>' karakterrel kezdődik'@' karakterrel kezdődikStrukturált LOCUS blokkTabulátorral elválasztott genomiális oszlopok
Elsődleges használatReferenciagenomok és BLAST keresésNyers nagy áteresztőképességű szekvenálók (Illumina)Átfogó annotált génekGenomikai funkcióannotációk
Fájlméret (emberi)~3 Gigabájt tömörítetlenül~100+ Gigabájt (minőségekkel)Több gigabájtos rich text~50 Megabájt

Gyakori sérülési módok és hexadecimális helyreállítási útmutató

A bioinformatikai eszköz 'Érvényesíthetetlen szekvenciakarakter az X. sorban' hibaüzenetet ad.

Kiváltó ok: Üres karakterek, számok vagy nem IUPAC karakterek a szekvenciasorokon belül.

Helyreállítás: Szekvenciakarakterek szűrése és tisztítása a File2File Bioinformatics Tool segítségével.

Biztonsági elemzés és elemző (parser) támadási vektorok

A genomikai eszközök hatalmas, több gigabájtos FASTA fájlokat elemeznek, ahol egész túlcsordulások fordulhatnak elő a szekvenciakoordináták indexelésekor.

Ismert támadási vektorok

  • Egész túlcsordulás a 32 bites szekvenciaindexelőkben (FAI), amelyek meghaladják a 2^31 bázispárt.
  • Puffertúlcsordulás túl hosszú szekvenciaazonosító fejlécek olvasásakor.
  • Szolgáltatásmegtagadás (DoS) patologikus illesztési lekérdezések révén.

Védekező Legjobb Gyakorlatok:

Történeti háttér és mérföldkövek

2003A Human Genome Project befejezi az emberi genom első szekvenálását, az eredményeket FASTA formátumban publikálva.
1990A BLAST (Basic Local Alignment Search Tool) a FASTA-t választja szabványos bemeneti formátumává.
1985William Pearson és David Lipman bevezeti a FASTA-t a FASTP szekvencia-illesztő szoftverrel.

Főbb előnyök

  • A számítógépes biológia vitathatatlan globális szabványa: a Föld minden genomiális eszköze, szekvenálója és adatbázisa használja.
  • Rendkívüli egyszerűség: az 1. sor a '>' karakterrel kezdődik, amelyet egy azonosító, majd sima szöveges genetikai betűk követnek.
  • Több szekvenciát tartalmazó kapacitás: egyetlen fájl ezer egyedi gént vagy teljes virális genomot tartalmazhat.

Technikai korlátok és hátrányok

  • Nem tartalmaz szekvenálási minőségi pontszámokat (ellentétben a FASTQ-val, amely bázisonkénti Phred megbízhatósági pontszámokat tárol).
  • Nincs szabványos metaadat-szintaxis a fejlécsorokhoz a kezdeti azonosítón túl.
  • Hatalmas tárolási lábnyom a teljes genomot lefedő adatkészleteknél Gzip vagy speciális genomiális tömörítés nélkül.

Érdekes technikai tudnivalók

  • A teljes, 3 milliárd bázispárból álló emberi genom ábrázolható FASTA formátumban, ami megközelítőleg 3 gigabájt tárhelyet vesz igénybe.
  • A FASTA fájlokban tárolt DNS négy betűje az A (adenin), a C (citozin), a G (guanin) és a T (timin).
  • Amikor a COVID-19 koronavírus genomját először szekvenálták 2020 januárjában, a tudósok globálisan egy 30 000 betűből álló FASTA fájlként osztották meg.

Gyakran Ismételt Műszaki Kérdések

Mi az a FASTA fájl?

A FASTA fájl egy biológiában használt egyszerű szövegfájl, amely DNS-, RNS- vagy fehérjeszekvenciákat tárol egyliteres rövidítések használatával.

Mi a különbség a FASTA és a FASTQ között?

A FASTA csak a genetikai szekvencia betűit tárolja, míg a FASTQ mind a betűket, mind az egyes bázisok szekvenálási pontossági minőségpontszámát.

Hogyan tekinthetek meg egy FASTA fájlt?

Megnyithatja a FASTA fájlokat bármilyen szövegszerkesztőben, megtekintheti őket olyan bioinformatikai szoftverekben, mint a Jalview vagy az UGENE, vagy átalakíthatja őket a File2File.app használatával.