FASTA последователност (.fasta)
Bioinformatics СтандартFASTA е вездесъщият, основен файлов формат в биоинформатиката и геномиката, представящ нуклеотидни последователности (ДНК, РНК) и аминокиселинни протеинови последователности с помощта на универсални еднобуквени кодове.
Конвертиране на FASTA към GENBANK
Безплатен конвертор от FASTA към GENBANK в браузъра. Конвертирайте файлове незабавно на вашето устройство.
Инспектиране и метаданни
Операционните системи и файловите анализатори идентифицират FASTA файлове чрез проверка на началната двоична байтова последователност:
Байтов подпис на хедъра (Magic Bytes)
Операционните системи и файловите анализатори идентифицират FASTA файлове чрез проверка на началната двоична байтова последователност:
HEX ПОДПИС (ОФСЕТ 0):
3EASCII ПРЕДСТАВЯНЕ: >
Стандартизация: Bioinformatics de facto global standard
Технически спецификации
| Контейнерна архитектура | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Компресия | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Поредност на байтовете (Endianness) | ASCII / UTF-8 text stream |
| Цветови пространства | N/A (Genomic Sequence Data) |
| Канали и структура | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Максимални размери | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Прозрачност | None |
| Стрийминг и прогресивно зареждане | Sequential record-by-record streaming processing |
Техническа сравнителна матрица: FASTA спрямо конкуренти
| Технически атрибут | FASTA (Текущ) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Оценки за качество | Няма (чисти букви на последователността) | Phred оценки за качество на база | Няма (анотации на характеристики) | Няма (координати на характеристики) |
| Хедър ред | Започва със знак '>' | Започва със знак '@' | Структуриран LOCUS блок | Геномни колони, разделени с табулация |
| Основно приложение | Референтни геноми и BLAST търсене | Сурови високопроизводителни секвентори (Illumina) | Изчерпателно анотирани гени | Анотации на геномни характеристики |
| Размер на файла (човешки) | ~3 гигабайта некомпресиран | ~100+ гигабайта (с качества) | Многогигабайтов богато форматиран текст | ~50 мегабайта |
Често срещани режими на повреда и ръководство за хекс възстановяване
Инструментът за биоинформатика съобщава 'Невалиден символ в последователността на ред X'.
Първопричина: Интервали, числа или символи извън IUPAC спецификацията вътре в редовете с последователности.
Възстановяване: Филтрирайте и изчистете символите на последователността с помощта на File2File Bioinformatics Tool.
Анализ на сигурността и вектори на атака към парсера
Геномните инструменти парсират масивни многогигабайтови FASTA файлове, където могат да възникнат целочислени препълвания при индексиране на координати на последователности.
Известни вектори на атака
- Целочислено препълване в 32-битови индексатори на последователности (FAI), надвишаващи 2^31 базови двойки.
- Препълване на буфера при четене на прекомерно дълги заглавни хедъри за идентификатори на последователности.
- Отказ от услуга (DoS) чрез патологични заявки за подредба (alignment).
Защитни добри практики:
Исторически произход и етапи
Основни предимства и плюсове
- Безспорният глобален стандарт на изчислителната биология: използван от всеки геномен инструмент, секвентор и база данни на Земята.
- Изключителна простота: ред 1 започва с '>' последван от идентификатор, следван от обикновени текстови генетични букви.
- Капацитет за множество последователности: един единствен файл може да съдържа хиляди отделни гени или пълни вирусни геноми.
Технически ограничения и минуси
- Не съдържа оценки за качеството на секвенирането (за разлика от FASTQ, който съхранява Phred оценки за надеждност на база).
- Няма стандартизиран синтаксис за метаданни за хедър редовете извън първоначалния идентификатор.
- Огромен отпечатък за съхранение за цели геномни набори от данни без Gzip или специализирана геномна компресия.
Интересни технически факти
- Целият човешки геном с неговите 3 милиарда базови двойки може да бъде представен във FASTA формат, заемайки приблизително 3 гигабайта пространство за съхранение.
- Четирите букви на ДНК, съхранявани във FASTA файлове, са A (Аденин), C (Цитозин), G (Гуанин) и T (Тимин).
- Когато геномът на коронавируса COVID-19 беше секвениран за първи път през януари 2020 г., учените го споделиха глобално като FASTA файл с дължина 30 000 букви.
Често задавани технически въпроси
Какво е FASTA файл?
FASTA файлът е текстов файл, използван в биологията за съхраняване на ДНК, РНК или протеинови последователности с помощта на еднобуквени съкращения.
Каква е разликата между FASTA и FASTQ?
FASTA съхранява само буквите на генетичната последователност, докато FASTQ съхранява както буквите, така и оценка за качеството на точността на секвенирането за всяка база.
Как мога да прегледам FASTA файл?
Можете да отваряте FASTA файлове в произволен текстов редактор, да ги преглеждате в биоинформатичен софтуер като Jalview или UGENE, или да ги конвертирате с помощта на File2File.app.
Свързани двойки за конвертиране на FASTA
Преобразуването на обикновена FASTA последователност в GenBank текстов файл добавя съществени биологични анотации и метаданни към суровия генетичен код.
Преобразуването на GenBank текстов файл в FASTA последователност премахва метаданните от анотациите, оставяйки само суровите нуклеотидни или аминокиселинни последователности, необходими за бърз биоинформатичен анализ.