Sekwencja FASTA (.fasta)

Bioinformatics Standardowy

FASTA to wszechobecny, fundamentalny format pliku bioinformatyki i genomiki, reprezentujący sekwencje nukleotydów (DNA, RNA) oraz sekwencje białkowe aminokwasów przy użyciu uniwersalnych kodów jednoliterowych.

Konwertuj FASTA na GENBANK

Darmowy konwerter z FASTA na GENBANK w przeglądarce. Konwertuj pliki natychmiast na swoim urządzeniu.

Inspekcja i metadane

Systemy operacyjne i analizatory plików identyfikują pliki FASTA, sprawdzając początkową sekwencję bajtów binarnych:

Wybierz lub upuść pliki tutaj

Konwersja w 100% prywatna w przeglądarce - pliki nigdy nie opuszczają Twojego urządzenia

lub wklej Ctrl+V
Gwarancja prywatności bez przesyłania danych do sieci: 0 bajtów przesłanych na zewnętrzne serwery. Całe przetwarzanie odbyło się lokalnie w piaskownicy przeglądarki.

Podpis nagłówka na poziomie bajtów (Magic Bytes)

Systemy operacyjne i analizatory plików identyfikują pliki FASTA, sprawdzając początkową sekwencję bajtów binarnych:

PODPIS HEX (OFFSET 0):

3E

REPREZENTACJA ASCII: >

Normalizacja: Bioinformatics de facto global standard

Specyfikacja techniczna

Architektura konteneraPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
KompresjaUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Kolejność bajtów (Endianness)ASCII / UTF-8 text stream
Przestrzenie kolorówN/A (Genomic Sequence Data)
Kanały i strukturaNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Maks. wymiaryUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
PrzezroczystośćNone
Streaming i progresywne ładowanieSequential record-by-record streaming processing

Techniczna macierz porównawcza: FASTA a konkurencja

Atrybut technicznyFASTA (Bieżący)FASTQGENBANKGFF
Wyniki jakościBrak (czyste litery sekwencji)Wyniki jakości Phreda dla każdej zasadyBrak (adnotacje cech)Brak (współrzędne cech)
Linia nagłówkaZaczyna się od znaku '>'Zaczyna się od znaku '@'Strukturalny blok LOCUSRozdzielone tabulatorami kolumny genomowe
Główne zastosowanieGenomy referencyjne i wyszukiwanie BLASTSurowe sekwenatory o wysokiej przepustowości (Illumina)Kompleksowe geny z adnotacjamiAdnotacje cech genomowych
Rozmiar pliku (człowiek)~3 gigabajty nieskompresowane~100+ gigabajtów (z jakością)Wielogigabajtowy sformatowany tekst~50 megabajtów

Typowe tryby uszkodzeń i przewodnik odzyskiwania szesnastkowego

Narzędzie bioinformatyczne zgłasza błąd 'Nieprawidłowy znak sekwencji w wierszu X'.

Główna przyczyna: Białe znaki, cyfry lub znaki spoza standardu IUPAC w liniach sekwencji.

Odzyskiwanie: Filtruj i oczyszczaj znaki sekwencji za pomocą narzędzia File2File Bioinformatics Tool.

Analiza bezpieczeństwa i wektory ataku na parser

Narzędzia genomowe analizują masywne wielogigabajtowe pliki FASTA, w których podczas indeksowania współrzędnych sekwencji może dojść do przepełnienia liczbowego.

Znane wektory ataku

  • Przepełnienie liczbowe w 32-bitowych indekserach sekwencji (FAI) przekraczających 2^31 par zasad.
  • Przepełnienie bufora podczas odczytu nadmiernie długich nagłówków identyfikatora sekwencji.
  • Atak typu odmowa usługi (DoS) poprzez patologiczne zapytania dopasowania.

Najlepsze praktyki obronne:

Pochodzenie historyczne i kamienie milowe

2003Projekt Ludzkiego Genomu kończy pierwsze sekwencjonowanie ludzkiego genomu, publikując wyniki w formacie FASTA.
1990Narzędzie BLAST (Basic Local Alignment Search Tool) przyjmuje format FASTA jako swój standardowy format wejściowy.
1985William Pearson i David Lipman wprowadzają format FASTA wraz z oprogramowaniem do dopasowywania sekwencji FASTP.

Główne zalety

  • Niezaprzeczalny globalny standard biologii obliczeniowej: używany przez każde narzędzie genomowe, sekwenator i bazę danych na Ziemi.
  • Ekstremalna prostota: linia 1 zaczyna się od '>' i identyfikatora, po którym następuje czysty tekst liter genetycznych.
  • Wydajność wielu sekwencji: pojedynczy plik może zawierać tysiące poszczególnych genów lub kompletne genomy wirusów.

Ograniczenia techniczne i wady

  • Nie zawiera wyników jakości sekwencjonowania (w przeciwieństwie do formatu FASTQ, który przechowuje wyniki wiarygodności Phreda dla każdej zasady).
  • Brak standaryzowanej składni metadanych dla linii nagłówka poza początkowym identyfikatorem.
  • Ogromny ślad pamięciowy dla zestawów danych całego genomu bez Gzip lub specjalistycznej kompresji genomowej.

Ciekawe informacje techniczne

  • Cały ludzki genom składający się z 3 miliardów par zasad można zapisać w formacie FASTA, co zajmuje około 3 gigabajty pamięci.
  • Cztery litery DNA przechowywane w plikach FASTA to A (adenina), C (cytozyna), G (guanina) i T (tymina).
  • Kiedy genom koronawirusa COVID-19 został po raz pierwszy zsekwencjonowany w styczniu 2020 r., naukowcy udostępnili go globalnie jako 30-tysięcznyliterowy plik FASTA.

Często zadawane pytania techniczne

Czym jest plik FASTA?

Plik FASTA to plik tekstowy używany w biologii do przechowywania sekwencji DNA, RNA lub białek przy użyciu jednoliterowych skrótów.

Jaka jest różnica między formatem FASTA a FASTQ?

FASTA przechowuje wyłącznie litery sekwencji genetycznej, podczas gdy FASTQ przechowuje zarówno litery, jak i wynik jakości dokładności sekwencjonowania dla każdej zasady.

Jak mogę wyświetlić plik FASTA?

Możesz otwierać pliki FASTA w dowolnym edytorze tekstowym, oglądać je w oprogramowaniu do bioinformatyki, takim jak Jalview lub UGENE, albo skonwertować je za pomocą File2File.app.