FASTA-последовательность (.fasta)
Де-факто СтандартFASTA - это повсеместный основополагающий формат файлов в биоинформатике и геномике, представляющий нуклеотидные последовательности (ДНК, РНК) и аминокислотные белковые последовательности с использованием универсальных однобуквенных кодов.
Конвертировать из FASTA в GENBANK
Бесплатный конвертер из FASTA в GENBANK прямо в браузере. Конвертируйте файлы мгновенно на вашем устройстве.
Анализ и метаданные
Операционные системы и анализаторы файлов идентифицируют файлы FASTA по начальной двоичной последовательности байтов:
Сигнатура заголовка на уровне байтов (Magic Bytes)
Операционные системы и анализаторы файлов идентифицируют файлы FASTA по начальной двоичной последовательности байтов:
HEX-СИГНАТУРА (СМЕЩЕНИЕ 0):
3EПРЕДСТАВЛЕНИЕ ASCII: >
Стандартизация: Де-факто глобальный стандарт биоинформатики
Технические спецификации
| Архитектура контейнера | Текстовый файл последовательности, где строки заголовков начинаются с '>' за которым следует идентификатор последовательности, а последующие строки содержат однобуквенные коды нуклеотидов или аминокислот |
| Сжатие | Несжатый текст (часто сжимается с помощью Gzip как .fasta.gz или .fa.gz) |
| Порядок байтов (Endianness) | Текстовый поток ASCII / UTF-8 |
| Цветовые пространства | Н/Д (Данные геномных последовательностей) |
| Каналы и структура | Коды нуклеиновых кислот (A, C, G, T, U, N) или 20 аминокислотных белковых кодов IUPAC |
| Макс. габариты | Неограниченная длина последовательности (поддерживает целые хромосомы человека размером более 250 миллионов пар оснований) |
| Прозрачность | Отсутствует |
| Потоковая передача и прогрессивная загрузка | Последовательная потоковая обработка запись за записью |
Техническая матрица сравнения: FASTA против конкурентов
| Технический атрибут | FASTA (Текущий) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Оценки качества | Отсутствуют (чистые буквы последовательности) | Показатели качества Phred для каждого основания | Отсутствуют (аннотации признаков) | Отсутствуют (координаты признаков) |
| Строка заголовка | Начинается с символа '>' | Начинается с символа '@' | Структурированный блок LOCUS | Геномные столбцы с разделителями-табуляциями |
| Основное назначение | Референтные геномы и поиск BLAST | Секвенаторы сырых высокопроизводительных данных (Illumina) | Комплексные аннотированные гены | Аннотации геномных признаков |
| Размер файла (человек) | ~3 гигабайта в несжатом виде | ~100+ гигабайт (с показателями качества) | Многогигабайтный текст с разметкой | ~50 мегабайт |
Типичные режимы повреждения и руководство по восстановлению в HEX
Инструмент биоинформатики сообщает об ошибке 'Недопустимый символ последовательности в строке X'.
Первопричина: Пробелы, цифры или символы вне номенклатуры IUPAC внутри строк последовательности.
Восстановление: Фильтрация и очистка символов последовательности с помощью File2File Bioinformatics Tool.
Анализ безопасности и векторы атак на парсер
Инструменты геномики анализируют массивные многогигабайтные файлы FASTA, где при индексировании координат последовательности может происходить переполнение целых чисел.
Известные векторы атак
- Переполнение целых чисел в 32-разрядных индексаторах последовательностей (FAI), превышающих 2^31 пар оснований.
- Переполнение буфера при чтении чрезмерно длинных заголовков идентификаторов последовательностей.
- Отказ в обслуживании посредством патологических запросов выравнивания.
Защитные лучшие практики: Используйте 64-разрядные типы координат и применяйте проверку максимальной длины заголовка.
Исторические истоки и вехи
Ключевые преимущества и плюсы
- Бесспорный глобальный стандарт вычислительной биологии: используется каждым геномным инструментом, секвенатором и базой данных на Земле.
- Экстремальная простота: строка 1 начинается с '>' за которым следует ID, а затем простой текст генетических букв.
- Емкость для множества последовательностей: один файл может содержать тысячи отдельных генов или полных вирусных геномов.
Технические ограничения и минусы
- Не содержит оценок качества секвенирования (в отличие от FASTQ, который хранит показатели достоверности Phred для каждого основания).
- Отсутствует стандартизированный синтаксис метаданных для строк заголовков помимо первоначального идентификатора.
- Огромный объем памяти для наборов данных полного генома без использования Gzip или специализированного геномного сжатия.
Интересные технические факты
- Весь геном человека размером в 3 миллиарда пар оснований может быть представлен в формате FASTA, занимая около 3 гигабайт дискового пространства.
- Четыре буквы ДНК, хранящиеся в файлах FASTA, - это A (Аденин), C (Цитозин), G (Гуанин) и T (Тимин).
- Когда геном коронавируса COVID-19 был впервые секвенирован в январе 2020 года, ученые поделились им во всем мире в виде файла FASTA длиной 30 000 букв.
Часто задаваемые технические вопросы
Что такое файл FASTA?
Файл FASTA - это простой текстовый файл, используемый в биологии для хранения последовательностей ДНК, РНК или белков с использованием однобуквенных аббревиатур.
В чем разница между FASTA и FASTQ?
FASTA хранит только буквы генетической последовательности, в то время как FASTQ хранит как буквы, так и оценку качества точности секвенирования для каждого основания.
Как просмотреть файл FASTA?
Вы можете открыть файлы FASTA в любом текстовом редакторе, просмотреть их в программном обеспечении для биоинформатики, таком как Jalview или UGENE, или конвертировать их с помощью File2File.app.
Связанные пары конвертации FASTA
Преобразование простой последовательности FASTA в плоский файл GenBank добавляет необходимые биологические аннотации и метаданные к необработанному генетическому коду.
Преобразование плоского файла GenBank в последовательность FASTA удаляет метаданные аннотаций, оставляя только нуклеотидные или аминокислотные последовательности, необходимые для быстрого биоинформатического анализа.