Послідовність FASTA (.fasta)

Bioinformatics Стандарт

FASTA - це всюдисущий фундаментальний файловий формат біоінформатики та геноміки, що представляє нуклеотидні послідовності (ДНК, РНК) та амінокислотні білкові послідовності за допомогою універсальних однолітерних кодів.

Конвертувати з FASTA у GENBANK

Безкоштовний конвертер з FASTA у GENBANK у браузері. Миттєво конвертуйте файли на своєму пристрої.

Аналіз та метадані

Операційні системи та аналізатори файлів ідентифікують файли FASTA, перевіряючи початкову послідовність бінарних байтів:

Виберіть або перетягніть файли сюди

100% приватна конвертація у браузері - файли ніколи не покидають ваш пристрій

або вставте Ctrl+V
Гарантія конфіденційності з нульовою передачею мережею: 0 байт завантажено на зовнішні сервери. Уся обробка виконується локально в пісочниці вашого браузера.

Сигнатура заголовка на байтовому рівні (Magic Bytes)

Операційні системи та аналізатори файлів ідентифікують файли FASTA, перевіряючи початкову послідовність бінарних байтів:

ШІСТНАДЦЯТКОВА СИГНАТУРА (ЗСУВ 0):

3E

ASCII-УЯВЛЕННЯ: >

Стандартизація: Bioinformatics de facto global standard

Технічні характеристики

Архітектура контейнераPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
СтисненняUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Порядок байтів (Endianness)ASCII / UTF-8 text stream
Колірні просториN/A (Genomic Sequence Data)
Канали та структураNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Максимальні розміриUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ПрозорістьNone
Потокове та прогресивне завантаженняSequential record-by-record streaming processing

Технічна матриця порівняння: FASTA проти конкурентів

Технічний атрибутFASTA (Поточний)FASTQGENBANKGFF
Оцінки якостіНемає (чисті літери послідовності)Показники якості Phred для кожної основиНемає (анотації ознак)Немає (координати ознак)
Рядок заголовкаПочинається з символу '>'Починається з символу '@'Структурований блок LOCUSГеномні стовпці, розділені табуляцією
Основне використанняЕталонні геноми та пошук BLASTСирі високопродуктивні секвенатори (Illumina)Всебічні анотовані гениАнотації геномних ознак
Розмір файлу (людина)~3 гігабайти без стиснення~100+ гігабайт (з показниками якості)Багатогігабайтний форматований текст~50 мегабайт

Типові режими пошкодження та посібник з відновлення в шістнадцятковому форматі

Біоінформатичний інструмент повідомляє: 'Неприпустимий символ послідовності в рядку X'.

Першопричина: Пробіли, цифри або символи, що не належать до IUPAC, усередині рядків послідовності.

Відновлення: Відфільтруйте та очистіть символи послідовності за допомогою File2File Bioinformatics Tool.

Аналіз безпеки та векторів атак на парсери

Геномні інструменти аналізують масивні багатогігабайтні файли FASTA, де під час індексування координат послідовності можуть виникати переповнення цілих чисел.

Відомі вектори атак

  • Переповнення цілих чисел у 32-бітних індексаторах послідовностей (FAI), що перевищують 2^31 пар основ.
  • Переповнення буфера під час читання надто довгих заголовків ідентифікаторів послідовностей.
  • Відмова в обслуговуванні через патологічні запити на вирівнювання.

Захисні найкращі практики:

Історичне походження та віхи

2003Проєкт 'Геном людини' завершує перше секвенування геному людини, публікуючи результати у форматі FASTA.
1990BLAST (Basic Local Alignment Search Tool) приймає FASTA як свій стандартний вхідний формат.
1985Вільям Пірсон і Девід Ліпман представляють FASTA разом із програмним забезпеченням для вирівнювання послідовностей FASTP.

Головні переваги та плюси

  • Беззаперечний глобальний стандарт обчислювальної біології: використовується кожним геномним інструментом, секвенатором та базою даних на Землі.
  • Екстремальна простота: рядок 1 починається з '>' за яким слідує ідентифікатор, а потім звичайні текстові генетичні літери.
  • Місткість кількох послідовностей: один файл може містити тисячі окремих генів або повні вірусні геноми.

Технічні обмеження та мінуси

  • Не містить оцінок якості секвенування (на відміну від FASTQ, який зберігає показники достовірності Phred для кожної основи).
  • Відсутність стандартизованого синтаксису метаданих для рядків заголовків поза початковим ідентифікатором.
  • Величезний обсяг пам'яті для наборов даних усього геному без Gzip або спеціалізованого геномного стиснення.

Цікаві технічні факти

  • Весь геном людини з 3 мільярдів пар основ може бути представлений у форматі FASTA, займаючи приблизно 3 гігабайти пам'яті.
  • Чотири букви ДНК, що зберігаються у файлах FASTA: A (аденін), C (цитозин), G (гуанін) та T (тимін).
  • Коли геном коронавірусу COVID-19 був вперше секвенований у січні 2020 року, вчені поділилися ним у всьому світі як файлом FASTA з 30 000 літер.

Поширені технічні запитання

Що таке файл FASTA?

Файл FASTA — це звичайний текстовий файл, який використовується в біології для зберігання послідовностей ДНК, РНК або білків за допомогою однолітерних абревіатур.

У чому різниця між FASTA та FASTQ?

FASTA зберігає лише літери генетичної послідовності, тоді як FASTQ зберігає як літери, так і показник якості точності секвенування для кожної основи.

Як переглянути файл FASTA?

Ви можете відкривати файли FASTA в будь-якому текстовому редакторі, переглядати їх у біоінформатичному програмному забезпеченні на кшталт Jalview чи UGENE або конвертувати за допомогою File2File.app.