FASTA Dizisi (.fasta)
Bioinformatics StandartFASTA, evrensel tek harfli kodları kullanarak nükleotit dizilerini (DNA, RNA) ve amino asit protein dizilerini temsil eden, biyoinformatik ve genomiğin her yerde bulunan temel dosya formatıdır.
FASTA formatını GENBANK formatına dönüştür
Ücretsiz tarayıcı içi FASTA - GENBANK dönüştürücü. Dosyalarınızı cihazınızda anında dönüştürün.
İncele & Meta Veriler
İşletim sistemleri ve dosya çözümleyicileri, FASTA dosyalarını başlangıçtaki ikili bayt dizisini inceleyerek tanımlar:
Bayt Düzeyinde Başlık İmzası (Magic Bytes)
İşletim sistemleri ve dosya çözümleyicileri, FASTA dosyalarını başlangıçtaki ikili bayt dizisini inceleyerek tanımlar:
HEX İMZASI (OFSET 0):
3EASCII GÖSTERİMİ: >
Standardizasyon: Bioinformatics de facto global standard
Teknik Özellikler
| Konteyner Mimarisi | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Sıkıştırma | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Bayt Düzeni (Endianness) | ASCII / UTF-8 text stream |
| Renk Uzayları | N/A (Genomic Sequence Data) |
| Kanallar ve Yapı | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maksimum Boyutlar | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Şeffaflık | None |
| Akış ve Aşamalı (Streaming & Progressive) | Sequential record-by-record streaming processing |
Teknik Karşılaştırma Matrisi: FASTA ve Rakipleri
| Teknik Nitelik | FASTA (Güncel) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Kalite Skorları | Yok (saf dizi harfleri) | Baz başına Phred kalite skorları | Yok (özellik ek açıklamaları) | Yok (özellik koordinatları) |
| Başlık Satırı | '>' karakteriyle başlar | '@' karakteriyle başlar | Yapılandırılmış LOCUS bloğu | Sekmeyle ayrılmış genomik sütunlar |
| Birincil Kullanım | Referans genomlar ve BLAST araması | Ham yüksek verimli sıralayıcılar (Illumina) | Kapsamlı açıklama eklenmiş genler | Genomik özellik ek açıklamaları |
| Dosya Boyutu (İnsan) | ~3 Gigabayt sıkıştırılmamış | ~100+ Gigabayt (kalitelerle birlikte) | Çok gigabaytlık zengin metin | ~50 Megabayt |
Yaygın Bozulma Modları ve Hex Kurtarma Kılavuzu
Biyoinformatik aracı 'X satırında geçersiz dizi karakteri' bildiriyor.
Kök Neden: Dizi satırlarının içinde boşluk, sayı veya IUPAC dışı karakterler.
Kurtarma: File2File Biyoinformatik Aracı kullanarak dizi karakterlerini filtreleyin ve temizleyin.
Güvenlik Analizi ve Ayrıştırıcı Saldırı Vektörleri
Genomik araçlar, dizi koordinatları dizinlenirken tamsayı taşmalarının oluşabileceği devasa çok gigabaytlık FASTA dosyalarını ayrıştırır.
Bilinen Saldırı Vektörleri
- 2^31 baz çiftini aşan 32-bit dizi dizinleyicilerinde (FAI) tamsayı taşması.
- Aşırı uzun dizi tanımlayıcı başlıkları okunurken arabellek taşıması.
- Patolojik hizalama sorguları yoluyla hizmet reddi.
Savunmacı En İyi Uygulamalar:
Tarihsel Kökenler ve Kilometre Taşları
Temel Avantajlar ve Artılar
- Hesaplamalı biyolojinin tartışmasız küresel standardı: Yeryüzündeki her genomik araç, sıralayıcı ve veritabanı tarafından kullanılır.
- Aşırı basitlik: 1. satır bir kimlikle takip edilen '>' ile başlar, ardından düz metin genetik harfler gelir.
- Çoklu dizi kapasitesi: tek bir dosya binlerce ayrı gen veya tam viral genom içerebilir.
Teknik Kısıtlamalar ve Eksiler
- Hiçbir dizileme kalite skoru içermez (baz başına Phred güven skorlarını depolayan FASTQ'nun aksine).
- İlk tanımlayıcının ötesinde başlık satırları için standartlaştırılmış meta veri sözdizimi yoktur.
- Gzip veya özel genomik sıkıştırma olmadan tam genom veri setleri için devasa depolama alanı gereksinimi.
İlginç Teknik Bilgiler
- 3 milyar baz çiftinden oluşan insan genomunun tamamı FASTA formatında temsil edilebilir ve yaklaşık 3 gigabayt depolama alanı kaplar.
- FASTA dosyalarında depolanan DNA'nın dört harfi A (Adenin), C (Sitozin), G (Guanin) ve T (Timin)'dir.
- COVID-19 koronavirüs genomu ilk kez Ocak 2020'de dizillendiğinde, bilim insanları bunu küresel olarak 30.000 harfli bir FASTA dosyası olarak paylaştı.
Sıkça Sorulan Teknik Sorular
FASTA dosyası nedir?
FASTA dosyası, biyolojide DNA, RNA veya protein dizilerini tek harfli kısaltmalar kullanarak saklamak için kullanılan düz metin dosyasıdır.
FASTA ve FASTQ arasındaki fark nedir?
FASTA yalnızca genetik dizi harflerini saklarken, FASTQ hem harfleri hem de her bir baz için dizileme doğruluğu kalite puanını saklar.
Bir FASTA dosyasını nasıl görüntüleyebilirim?
FASTA dosyalarını herhangi bir metin düzenleyicide açabilir, Jalview veya UGENE gibi biyoinformatik yazılımlarında görüntüleyebilir veya File2File.app kullanarak dönüştürebilirsiniz.
İlgili FASTA Dönüşüm Çiftleri
Ham bir FASTA biyolojik dizisini açıklamalı bir GenBank düz dosyasına dönüştürmek, gelişmiş genetik araştırmalar için gerekli meta verileri ve biyolojik özellikleri ekler.
GenBank Düz Dosyasını FASTA Dizisine dönüştürmek, hızlı hesaplamalı işleme için gereken yalnızca ham nükleotit veya amino asit dizilerini bırakmak üzere karmaşık biyolojik açıklamaları ortadan kaldırır.