Послідовність FASTA (.fasta)
Bioinformatics СтандартFASTA - це всюдисущий фундаментальний файловий формат біоінформатики та геноміки, що представляє нуклеотидні послідовності (ДНК, РНК) та амінокислотні білкові послідовності за допомогою універсальних однолітерних кодів.
Конвертувати з FASTA у GENBANK
Безкоштовний конвертер з FASTA у GENBANK у браузері. Миттєво конвертуйте файли на своєму пристрої.
Аналіз та метадані
Операційні системи та аналізатори файлів ідентифікують файли FASTA, перевіряючи початкову послідовність бінарних байтів:
Сигнатура заголовка на байтовому рівні (Magic Bytes)
Операційні системи та аналізатори файлів ідентифікують файли FASTA, перевіряючи початкову послідовність бінарних байтів:
ШІСТНАДЦЯТКОВА СИГНАТУРА (ЗСУВ 0):
3EASCII-УЯВЛЕННЯ: >
Стандартизація: Bioinformatics de facto global standard
Технічні характеристики
| Архітектура контейнера | Plaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes |
| Стиснення | Uncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz) |
| Порядок байтів (Endianness) | ASCII / UTF-8 text stream |
| Колірні простори | N/A (Genomic Sequence Data) |
| Канали та структура | Nucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes |
| Максимальні розміри | Unbounded sequence length (supports entire human chromosomes over 250 million base pairs) |
| Прозорість | None |
| Потокове та прогресивне завантаження | Sequential record-by-record streaming processing |
Технічна матриця порівняння: FASTA проти конкурентів
| Технічний атрибут | FASTA (Поточний) | FASTQ | GENBANK | GFF |
|---|---|---|---|---|
| Оцінки якості | Немає (чисті літери послідовності) | Показники якості Phred для кожної основи | Немає (анотації ознак) | Немає (координати ознак) |
| Рядок заголовка | Починається з символу '>' | Починається з символу '@' | Структурований блок LOCUS | Геномні стовпці, розділені табуляцією |
| Основне використання | Еталонні геноми та пошук BLAST | Сирі високопродуктивні секвенатори (Illumina) | Всебічні анотовані гени | Анотації геномних ознак |
| Розмір файлу (людина) | ~3 гігабайти без стиснення | ~100+ гігабайт (з показниками якості) | Багатогігабайтний форматований текст | ~50 мегабайт |
Типові режими пошкодження та посібник з відновлення в шістнадцятковому форматі
Біоінформатичний інструмент повідомляє: 'Неприпустимий символ послідовності в рядку X'.
Першопричина: Пробіли, цифри або символи, що не належать до IUPAC, усередині рядків послідовності.
Відновлення: Відфільтруйте та очистіть символи послідовності за допомогою File2File Bioinformatics Tool.
Аналіз безпеки та векторів атак на парсери
Геномні інструменти аналізують масивні багатогігабайтні файли FASTA, де під час індексування координат послідовності можуть виникати переповнення цілих чисел.
Відомі вектори атак
- Переповнення цілих чисел у 32-бітних індексаторах послідовностей (FAI), що перевищують 2^31 пар основ.
- Переповнення буфера під час читання надто довгих заголовків ідентифікаторів послідовностей.
- Відмова в обслуговуванні через патологічні запити на вирівнювання.
Захисні найкращі практики:
Історичне походження та віхи
Головні переваги та плюси
- Беззаперечний глобальний стандарт обчислювальної біології: використовується кожним геномним інструментом, секвенатором та базою даних на Землі.
- Екстремальна простота: рядок 1 починається з '>' за яким слідує ідентифікатор, а потім звичайні текстові генетичні літери.
- Місткість кількох послідовностей: один файл може містити тисячі окремих генів або повні вірусні геноми.
Технічні обмеження та мінуси
- Не містить оцінок якості секвенування (на відміну від FASTQ, який зберігає показники достовірності Phred для кожної основи).
- Відсутність стандартизованого синтаксису метаданих для рядків заголовків поза початковим ідентифікатором.
- Величезний обсяг пам'яті для наборов даних усього геному без Gzip або спеціалізованого геномного стиснення.
Цікаві технічні факти
- Весь геном людини з 3 мільярдів пар основ може бути представлений у форматі FASTA, займаючи приблизно 3 гігабайти пам'яті.
- Чотири букви ДНК, що зберігаються у файлах FASTA: A (аденін), C (цитозин), G (гуанін) та T (тимін).
- Коли геном коронавірусу COVID-19 був вперше секвенований у січні 2020 року, вчені поділилися ним у всьому світі як файлом FASTA з 30 000 літер.
Поширені технічні запитання
Що таке файл FASTA?
Файл FASTA — це звичайний текстовий файл, який використовується в біології для зберігання послідовностей ДНК, РНК або білків за допомогою однолітерних абревіатур.
У чому різниця між FASTA та FASTQ?
FASTA зберігає лише літери генетичної послідовності, тоді як FASTQ зберігає як літери, так і показник якості точності секвенування для кожної основи.
Як переглянути файл FASTA?
Ви можете відкривати файли FASTA в будь-якому текстовому редакторі, переглядати їх у біоінформатичному програмному забезпеченні на кшталт Jalview чи UGENE або конвертувати за допомогою File2File.app.
Пов'язані пари конвертації FASTA
Перетворення звичайного тексту FASTA у формат GenBank Flatfile додає необхідні біологічні анотації та метадані до сирого генетичного коду.
Перетворення файлу GenBank Flatfile у послідовність FASTA видаляє метадані анотацій, залишаючи лише сирі нуклеотидні або амінокислотні послідовності, необхідні для швидкого бііоінформатичного аналізу.