Sekwencja FASTA (.fasta)
Bioinformatics StandardowyFASTA to wszechobecny, fundamentalny format pliku bioinformatyki i genomiki, reprezentujący sekwencje nukleotydów (DNA, RNA) oraz sekwencje białkowe aminokwasów przy użyciu uniwersalnych kodów jednoliterowych.
Konwertuj FASTA na GENBANK
Darmowy konwerter z FASTA na GENBANK w przeglądarce. Konwertuj pliki natychmiast na swoim urządzeniu.
Inspekcja i metadane
Systemy operacyjne i analizatory plików identyfikują pliki FASTA, sprawdzając początkową sekwencję bajtów binarnych:
Podpis nagłówka na poziomie bajtów (Magic Bytes)
Systemy operacyjne i analizatory plików identyfikują pliki FASTA, sprawdzając początkową sekwencję bajtów binarnych:
PODPIS HEX (OFFSET 0):
3EREPREZENTACJA ASCII: >
Normalizacja: Bioinformatics de facto global standard
Specyfikacja techniczna
| Architektura kontenera | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Kompresja | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Kolejność bajtów (Endianness) | ASCII / UTF-8 text stream |
| Przestrzenie kolorów | N/A (Genomic Sequence Data) |
| Kanały i struktura | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Maks. wymiary | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Przezroczystość | None |
| Streaming i progresywne ładowanie | Sequential record-by-record streaming processing |
Techniczna macierz porównawcza: FASTA a konkurencja
| Atrybut techniczny | FASTA (Bieżący) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Wyniki jakości | Brak (czyste litery sekwencji) | Wyniki jakości Phreda dla każdej zasady | Brak (adnotacje cech) | Brak (współrzędne cech) |
| Linia nagłówka | Zaczyna się od znaku '>' | Zaczyna się od znaku '@' | Strukturalny blok LOCUS | Rozdzielone tabulatorami kolumny genomowe |
| Główne zastosowanie | Genomy referencyjne i wyszukiwanie BLAST | Surowe sekwenatory o wysokiej przepustowości (Illumina) | Kompleksowe geny z adnotacjami | Adnotacje cech genomowych |
| Rozmiar pliku (człowiek) | ~3 gigabajty nieskompresowane | ~100+ gigabajtów (z jakością) | Wielogigabajtowy sformatowany tekst | ~50 megabajtów |
Typowe tryby uszkodzeń i przewodnik odzyskiwania szesnastkowego
Narzędzie bioinformatyczne zgłasza błąd 'Nieprawidłowy znak sekwencji w wierszu X'.
Główna przyczyna: Białe znaki, cyfry lub znaki spoza standardu IUPAC w liniach sekwencji.
Odzyskiwanie: Filtruj i oczyszczaj znaki sekwencji za pomocą narzędzia File2File Bioinformatics Tool.
Analiza bezpieczeństwa i wektory ataku na parser
Narzędzia genomowe analizują masywne wielogigabajtowe pliki FASTA, w których podczas indeksowania współrzędnych sekwencji może dojść do przepełnienia liczbowego.
Znane wektory ataku
- Przepełnienie liczbowe w 32-bitowych indekserach sekwencji (FAI) przekraczających 2^31 par zasad.
- Przepełnienie bufora podczas odczytu nadmiernie długich nagłówków identyfikatora sekwencji.
- Atak typu odmowa usługi (DoS) poprzez patologiczne zapytania dopasowania.
Najlepsze praktyki obronne:
Pochodzenie historyczne i kamienie milowe
Główne zalety
- Niezaprzeczalny globalny standard biologii obliczeniowej: używany przez każde narzędzie genomowe, sekwenator i bazę danych na Ziemi.
- Ekstremalna prostota: linia 1 zaczyna się od '>' i identyfikatora, po którym następuje czysty tekst liter genetycznych.
- Wydajność wielu sekwencji: pojedynczy plik może zawierać tysiące poszczególnych genów lub kompletne genomy wirusów.
Ograniczenia techniczne i wady
- Nie zawiera wyników jakości sekwencjonowania (w przeciwieństwie do formatu FASTQ, który przechowuje wyniki wiarygodności Phreda dla każdej zasady).
- Brak standaryzowanej składni metadanych dla linii nagłówka poza początkowym identyfikatorem.
- Ogromny ślad pamięciowy dla zestawów danych całego genomu bez Gzip lub specjalistycznej kompresji genomowej.
Ciekawe informacje techniczne
- Cały ludzki genom składający się z 3 miliardów par zasad można zapisać w formacie FASTA, co zajmuje około 3 gigabajty pamięci.
- Cztery litery DNA przechowywane w plikach FASTA to A (adenina), C (cytozyna), G (guanina) i T (tymina).
- Kiedy genom koronawirusa COVID-19 został po raz pierwszy zsekwencjonowany w styczniu 2020 r., naukowcy udostępnili go globalnie jako 30-tysięcznyliterowy plik FASTA.
Często zadawane pytania techniczne
Czym jest plik FASTA?
Plik FASTA to plik tekstowy używany w biologii do przechowywania sekwencji DNA, RNA lub białek przy użyciu jednoliterowych skrótów.
Jaka jest różnica między formatem FASTA a FASTQ?
FASTA przechowuje wyłącznie litery sekwencji genetycznej, podczas gdy FASTQ przechowuje zarówno litery, jak i wynik jakości dokładności sekwencjonowania dla każdej zasady.
Jak mogę wyświetlić plik FASTA?
Możesz otwierać pliki FASTA w dowolnym edytorze tekstowym, oglądać je w oprogramowaniu do bioinformatyki, takim jak Jalview lub UGENE, albo skonwertować je za pomocą File2File.app.
Powiązane pary konwersji FASTA
Konwersja zwykłej sekwencji FASTA na plik płaski GenBank dodaje niezbędne adnotacje biologiczne i metadane do surowego kodu genetycznego.
Konwersja pliku płaskiego GenBank na sekwencję FASTA usuwa metadane adnotacji, pozostawiając jedynie surowe sekwencje nukleotydów lub aminokwasów niezbędne do szybkiej analizy bioinformatycznej.