FASTA-последовательность (.fasta)

Де-факто Стандарт

FASTA - это повсеместный основополагающий формат файлов в биоинформатике и геномике, представляющий нуклеотидные последовательности (ДНК, РНК) и аминокислотные белковые последовательности с использованием универсальных однобуквенных кодов.

Конвертировать из FASTA в GENBANK

Бесплатный конвертер из FASTA в GENBANK прямо в браузере. Конвертируйте файлы мгновенно на вашем устройстве.

Анализ и метаданные

Операционные системы и анализаторы файлов идентифицируют файлы FASTA по начальной двоичной последовательности байтов:

Выберите или перетащите файлы сюда

100% конфиденциальное преобразование в браузере - файлы никогда не покидают ваше устройство

или вставьте Ctrl+V
Гарантия конфиденциальности без передачи по сети: 0 байт загружено на внешние серверы. Вся обработка выполняется локально в песочнице вашего браузера.

Сигнатура заголовка на уровне байтов (Magic Bytes)

Операционные системы и анализаторы файлов идентифицируют файлы FASTA по начальной двоичной последовательности байтов:

HEX-СИГНАТУРА (СМЕЩЕНИЕ 0):

3E

ПРЕДСТАВЛЕНИЕ ASCII: >

Стандартизация: Де-факто глобальный стандарт биоинформатики

Технические спецификации

Архитектура контейнераТекстовый файл последовательности, где строки заголовков начинаются с '>' за которым следует идентификатор последовательности, а последующие строки содержат однобуквенные коды нуклеотидов или аминокислот
СжатиеНесжатый текст (часто сжимается с помощью Gzip как .fasta.gz или .fa.gz)
Порядок байтов (Endianness)Текстовый поток ASCII / UTF-8
Цветовые пространстваН/Д (Данные геномных последовательностей)
Каналы и структураКоды нуклеиновых кислот (A, C, G, T, U, N) или 20 аминокислотных белковых кодов IUPAC
Макс. габаритыНеограниченная длина последовательности (поддерживает целые хромосомы человека размером более 250 миллионов пар оснований)
ПрозрачностьОтсутствует
Потоковая передача и прогрессивная загрузкаПоследовательная потоковая обработка запись за записью

Техническая матрица сравнения: FASTA против конкурентов

Технический атрибутFASTA (Текущий)FASTQGENBANKGFF
Оценки качестваОтсутствуют (чистые буквы последовательности)Показатели качества Phred для каждого основанияОтсутствуют (аннотации признаков)Отсутствуют (координаты признаков)
Строка заголовкаНачинается с символа '>'Начинается с символа '@'Структурированный блок LOCUSГеномные столбцы с разделителями-табуляциями
Основное назначениеРеферентные геномы и поиск BLASTСеквенаторы сырых высокопроизводительных данных (Illumina)Комплексные аннотированные геныАннотации геномных признаков
Размер файла (человек)~3 гигабайта в несжатом виде~100+ гигабайт (с показателями качества)Многогигабайтный текст с разметкой~50 мегабайт

Типичные режимы повреждения и руководство по восстановлению в HEX

Инструмент биоинформатики сообщает об ошибке 'Недопустимый символ последовательности в строке X'.

Первопричина: Пробелы, цифры или символы вне номенклатуры IUPAC внутри строк последовательности.

Восстановление: Фильтрация и очистка символов последовательности с помощью File2File Bioinformatics Tool.

Анализ безопасности и векторы атак на парсер

Инструменты геномики анализируют массивные многогигабайтные файлы FASTA, где при индексировании координат последовательности может происходить переполнение целых чисел.

Известные векторы атак

  • Переполнение целых чисел в 32-разрядных индексаторах последовательностей (FAI), превышающих 2^31 пар оснований.
  • Переполнение буфера при чтении чрезмерно длинных заголовков идентификаторов последовательностей.
  • Отказ в обслуживании посредством патологических запросов выравнивания.

Защитные лучшие практики: Используйте 64-разрядные типы координат и применяйте проверку максимальной длины заголовка.

Исторические истоки и вехи

2003Проект 'Геном человека' завершает первое секвенирование генома человека, публикуя результаты в формате FASTA.
1990Инструмент BLAST (Basic Local Alignment Search Tool) принимает FASTA в качестве стандартного входного формата.
1985Уильям Пирсон и Дэвид Липман представляют формат FASTA вместе с программой выравнивания последовательностей FASTP.

Ключевые преимущества и плюсы

  • Бесспорный глобальный стандарт вычислительной биологии: используется каждым геномным инструментом, секвенатором и базой данных на Земле.
  • Экстремальная простота: строка 1 начинается с '>' за которым следует ID, а затем простой текст генетических букв.
  • Емкость для множества последовательностей: один файл может содержать тысячи отдельных генов или полных вирусных геномов.

Технические ограничения и минусы

  • Не содержит оценок качества секвенирования (в отличие от FASTQ, который хранит показатели достоверности Phred для каждого основания).
  • Отсутствует стандартизированный синтаксис метаданных для строк заголовков помимо первоначального идентификатора.
  • Огромный объем памяти для наборов данных полного генома без использования Gzip или специализированного геномного сжатия.

Интересные технические факты

  • Весь геном человека размером в 3 миллиарда пар оснований может быть представлен в формате FASTA, занимая около 3 гигабайт дискового пространства.
  • Четыре буквы ДНК, хранящиеся в файлах FASTA, - это A (Аденин), C (Цитозин), G (Гуанин) и T (Тимин).
  • Когда геном коронавируса COVID-19 был впервые секвенирован в январе 2020 года, ученые поделились им во всем мире в виде файла FASTA длиной 30 000 букв.

Часто задаваемые технические вопросы

Что такое файл FASTA?

Файл FASTA - это простой текстовый файл, используемый в биологии для хранения последовательностей ДНК, РНК или белков с использованием однобуквенных аббревиатур.

В чем разница между FASTA и FASTQ?

FASTA хранит только буквы генетической последовательности, в то время как FASTQ хранит как буквы, так и оценку качества точности секвенирования для каждого основания.

Как просмотреть файл FASTA?

Вы можете открыть файлы FASTA в любом текстовом редакторе, просмотреть их в программном обеспечении для биоинформатики, таком как Jalview или UGENE, или конвертировать их с помощью File2File.app.