FASTA последователност (.fasta)

Bioinformatics Стандарт

FASTA е вездесъщият, основен файлов формат в биоинформатиката и геномиката, представящ нуклеотидни последователности (ДНК, РНК) и аминокиселинни протеинови последователности с помощта на универсални еднобуквени кодове.

Конвертиране на FASTA към GENBANK

Безплатен конвертор от FASTA към GENBANK в браузъра. Конвертирайте файлове незабавно на вашето устройство.

Инспектиране и метаданни

Операционните системи и файловите анализатори идентифицират FASTA файлове чрез проверка на началната двоична байтова последователност:

Изберете или пуснете файлове тук

100% поверително конвертиране в браузъра - файловете никога не напускат вашето устройство

или поставете Ctrl+V
Гаранция за поверителност с нулево мрежово предаване: 0 байта са качени на външни сървъри. Цялата обработка се извършва локално в пясъчниците на вашия браузър.

Байтов подпис на хедъра (Magic Bytes)

Операционните системи и файловите анализатори идентифицират FASTA файлове чрез проверка на началната двоична байтова последователност:

HEX ПОДПИС (ОФСЕТ 0):

3E

ASCII ПРЕДСТАВЯНЕ: >

Стандартизация: Bioinformatics de facto global standard

Технически спецификации

Контейнерна архитектураPlaintext sequence file where header lines start with '>' followed by sequence identifier, and succeeding lines contain single-letter nucleotide or amino acid codes
КомпресияUncompressed text (frequently compressed with Gzip as .fasta.gz or .fa.gz)
Поредност на байтовете (Endianness)ASCII / UTF-8 text stream
Цветови пространстваN/A (Genomic Sequence Data)
Канали и структураNucleic acid codes (A, C, G, T, U, N) or IUPAC 20 amino acid protein codes
Максимални размериUnbounded sequence length (supports entire human chromosomes over 250 million base pairs)
ПрозрачностNone
Стрийминг и прогресивно зарежданеSequential record-by-record streaming processing

Техническа сравнителна матрица: FASTA спрямо конкуренти

Технически атрибутFASTA (Текущ)FASTQGENBANKGFF
Оценки за качествоНяма (чисти букви на последователността)Phred оценки за качество на базаНяма (анотации на характеристики)Няма (координати на характеристики)
Хедър редЗапочва със знак '>'Започва със знак '@'Структуриран LOCUS блокГеномни колони, разделени с табулация
Основно приложениеРеферентни геноми и BLAST търсенеСурови високопроизводителни секвентори (Illumina)Изчерпателно анотирани гениАнотации на геномни характеристики
Размер на файла (човешки)~3 гигабайта некомпресиран~100+ гигабайта (с качества)Многогигабайтов богато форматиран текст~50 мегабайта

Често срещани режими на повреда и ръководство за хекс възстановяване

Инструментът за биоинформатика съобщава 'Невалиден символ в последователността на ред X'.

Първопричина: Интервали, числа или символи извън IUPAC спецификацията вътре в редовете с последователности.

Възстановяване: Филтрирайте и изчистете символите на последователността с помощта на File2File Bioinformatics Tool.

Анализ на сигурността и вектори на атака към парсера

Геномните инструменти парсират масивни многогигабайтови FASTA файлове, където могат да възникнат целочислени препълвания при индексиране на координати на последователности.

Известни вектори на атака

  • Целочислено препълване в 32-битови индексатори на последователности (FAI), надвишаващи 2^31 базови двойки.
  • Препълване на буфера при четене на прекомерно дълги заглавни хедъри за идентификатори на последователности.
  • Отказ от услуга (DoS) чрез патологични заявки за подредба (alignment).

Защитни добри практики:

Исторически произход и етапи

2003Проектът за човешкия геном завършва първото секвениране на човешкия геном, публикувайки резултатите във FASTA формат.
1990BLAST (Basic Local Alignment Search Tool) възприема FASTA за свой стандартен входен формат.
1985Уилям Пиърсън и Дейвид Липман въвеждат FASTA съвместно със софтуера за подредба на последователности FASTP.

Основни предимства и плюсове

  • Безспорният глобален стандарт на изчислителната биология: използван от всеки геномен инструмент, секвентор и база данни на Земята.
  • Изключителна простота: ред 1 започва с '>' последван от идентификатор, следван от обикновени текстови генетични букви.
  • Капацитет за множество последователности: един единствен файл може да съдържа хиляди отделни гени или пълни вирусни геноми.

Технически ограничения и минуси

  • Не съдържа оценки за качеството на секвенирането (за разлика от FASTQ, който съхранява Phred оценки за надеждност на база).
  • Няма стандартизиран синтаксис за метаданни за хедър редовете извън първоначалния идентификатор.
  • Огромен отпечатък за съхранение за цели геномни набори от данни без Gzip или специализирана геномна компресия.

Интересни технически факти

  • Целият човешки геном с неговите 3 милиарда базови двойки може да бъде представен във FASTA формат, заемайки приблизително 3 гигабайта пространство за съхранение.
  • Четирите букви на ДНК, съхранявани във FASTA файлове, са A (Аденин), C (Цитозин), G (Гуанин) и T (Тимин).
  • Когато геномът на коронавируса COVID-19 беше секвениран за първи път през януари 2020 г., учените го споделиха глобално като FASTA файл с дължина 30 000 букви.

Често задавани технически въпроси

Какво е FASTA файл?

FASTA файлът е текстов файл, използван в биологията за съхраняване на ДНК, РНК или протеинови последователности с помощта на еднобуквени съкращения.

Каква е разликата между FASTA и FASTQ?

FASTA съхранява само буквите на генетичната последователност, докато FASTQ съхранява както буквите, така и оценка за качеството на точността на секвенирането за всяка база.

Как мога да прегледам FASTA файл?

Можете да отваряте FASTA файлове в произволен текстов редактор, да ги преглеждате в биоинформатичен софтуер като Jalview или UGENE, или да ги конвертирате с помощта на File2File.app.