FASTA szekvencia (.fasta)
Bioinformatics SzabványA FASTA a bioinformatika és a genomika mindenütt jelen lévő, alapvető fájlformátuma, amely nukleotid-szekvenciákat (DNS, RNS) és aminosav-fehérjeszekvenciákat ábrázol univerzális egyliteres kódok használatával.
FASTA konvertálása erre: GENBANK
Ingyenes, böngészőn belüli FASTA - GENBANK konvertáló. Konvertáljon fájlokat azonnal az eszközén.
Vizsgálat és metaadatok
Az operációs rendszerek és a fájlelemzők a kezdő bináris bájtsorozat vizsgálatával azonosítják a(z) FASTA fájlokat:
Bájt-szintű fejléc aláírás (Magic Bytes)
Az operációs rendszerek és a fájlelemzők a kezdő bináris bájtsorozat vizsgálatával azonosítják a(z) FASTA fájlokat:
HEX ALÁÍRÁS (ELTOLÁS 0):
3EASCII REPREZENTÁCIÓ: >
Szabványosítás: Bioinformatics de facto global standard
Műszaki specifikációk
| Konténer architektúra | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Tömörítés | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Bájtsorrend | ASCII / UTF-8 text stream |
| Színterek | N/A (Genomic Sequence Data) |
| Csatornák és struktúra | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Max. méretek | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Átlátszóság | None |
| Streaming és progresszív | Sequential record-by-record streaming processing |
Műszaki összehasonlító mátrix: FASTA vs Versenytársak
| Technikai attribútum | FASTA (Jelenlegi) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Minőségi pontszámok | Nincs (tiszta szekvenciabetűk) | Bázisonkénti Phred minőségi pontszámok | Nincs (funkcióannotációk) | Nincs (funkciókoordináták) |
| Fejlécsor | '>' karakterrel kezdődik | '@' karakterrel kezdődik | Strukturált LOCUS blokk | Tabulátorral elválasztott genomiális oszlopok |
| Elsődleges használat | Referenciagenomok és BLAST keresés | Nyers nagy áteresztőképességű szekvenálók (Illumina) | Átfogó annotált gének | Genomikai funkcióannotációk |
| Fájlméret (emberi) | ~3 Gigabájt tömörítetlenül | ~100+ Gigabájt (minőségekkel) | Több gigabájtos rich text | ~50 Megabájt |
Gyakori sérülési módok és hexadecimális helyreállítási útmutató
A bioinformatikai eszköz 'Érvényesíthetetlen szekvenciakarakter az X. sorban' hibaüzenetet ad.
Kiváltó ok: Üres karakterek, számok vagy nem IUPAC karakterek a szekvenciasorokon belül.
Helyreállítás: Szekvenciakarakterek szűrése és tisztítása a File2File Bioinformatics Tool segítségével.
Biztonsági elemzés és elemző (parser) támadási vektorok
A genomikai eszközök hatalmas, több gigabájtos FASTA fájlokat elemeznek, ahol egész túlcsordulások fordulhatnak elő a szekvenciakoordináták indexelésekor.
Ismert támadási vektorok
- Egész túlcsordulás a 32 bites szekvenciaindexelőkben (FAI), amelyek meghaladják a 2^31 bázispárt.
- Puffertúlcsordulás túl hosszú szekvenciaazonosító fejlécek olvasásakor.
- Szolgáltatásmegtagadás (DoS) patologikus illesztési lekérdezések révén.
Védekező Legjobb Gyakorlatok:
Történeti háttér és mérföldkövek
Főbb előnyök
- A számítógépes biológia vitathatatlan globális szabványa: a Föld minden genomiális eszköze, szekvenálója és adatbázisa használja.
- Rendkívüli egyszerűség: az 1. sor a '>' karakterrel kezdődik, amelyet egy azonosító, majd sima szöveges genetikai betűk követnek.
- Több szekvenciát tartalmazó kapacitás: egyetlen fájl ezer egyedi gént vagy teljes virális genomot tartalmazhat.
Technikai korlátok és hátrányok
- Nem tartalmaz szekvenálási minőségi pontszámokat (ellentétben a FASTQ-val, amely bázisonkénti Phred megbízhatósági pontszámokat tárol).
- Nincs szabványos metaadat-szintaxis a fejlécsorokhoz a kezdeti azonosítón túl.
- Hatalmas tárolási lábnyom a teljes genomot lefedő adatkészleteknél Gzip vagy speciális genomiális tömörítés nélkül.
Érdekes technikai tudnivalók
- A teljes, 3 milliárd bázispárból álló emberi genom ábrázolható FASTA formátumban, ami megközelítőleg 3 gigabájt tárhelyet vesz igénybe.
- A FASTA fájlokban tárolt DNS négy betűje az A (adenin), a C (citozin), a G (guanin) és a T (timin).
- Amikor a COVID-19 koronavírus genomját először szekvenálták 2020 januárjában, a tudósok globálisan egy 30 000 betűből álló FASTA fájlként osztották meg.
Gyakran Ismételt Műszaki Kérdések
Mi az a FASTA fájl?
A FASTA fájl egy biológiában használt egyszerű szövegfájl, amely DNS-, RNS- vagy fehérjeszekvenciákat tárol egyliteres rövidítések használatával.
Mi a különbség a FASTA és a FASTQ között?
A FASTA csak a genetikai szekvencia betűit tárolja, míg a FASTQ mind a betűket, mind az egyes bázisok szekvenálási pontossági minőségpontszámát.
Hogyan tekinthetek meg egy FASTA fájlt?
Megnyithatja a FASTA fájlokat bármilyen szövegszerkesztőben, megtekintheti őket olyan bioinformatikai szoftverekben, mint a Jalview vagy az UGENE, vagy átalakíthatja őket a File2File.app használatával.
Kapcsolódó FASTA konverziós párok
Egy egyszerű FASTA-szekvencia átalakítása GenBank-fájllá alapvető biológiai annotációkat és metaadatokat ad hozzá a nyers genetikai kódhoz.
Egy GenBank-fájl átalakítása FASTA-szekvenciává eltávolítja az annotációs metaadatokat, így csak a gyors bioinformatikai elemzéshez szükséges nyers nukleotid- vagy aminosav-szekvenciák maradnak.