Научная статья

learnMSA2: глубокое множественное выравнивание белковых последовательностей с использованием больших языковых моделей и скрытых марковских моделей

learnMSA2: deep protein multiple alignments with large language and hidden Markov models

Bioinformatics (Oxford, England)
10.1093/bioinformatics/btae381
Полный текст Открыть в журнале PubMed PMC
FWCI: 0.93FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 9 · Ссылки: 36 · Лицензия: CC-BY
Цитирование по годам: 2026: 3 · 2025: 3

Аннотация

Обоснование: Для выравнивания большого числа белковых последовательностей преимущественно используют инструменты, которые решают, следует ли сопоставлять две аминокислоты, основываясь лишь на простых априорных знаниях, например матрицах замен аминокислот, и используют только часть доступных данных. Точность современных программ снижается при уменьшении идентичности последовательностей и увеличении их числа. Недавно трансформерные модели глубокого обучения начали использовать огромный объём данных о белковых последовательностях, что привело к появлению мощных предварительно обученных языковых моделей, предназначенных главным образом для формирования высокоразмерных числовых представлений отдельных позиций — эмбеддингов, объединяющих эволюционную, структурную и биофизическую информацию.

Результаты: Мы расширили традиционную профильную скрытую марковскую модель, добавив возможность подавать на вход невыравненные белковые последовательности и соответствующие им эмбеддинги. Обучение модели выполняли методом градиентного спуска с использованием ранее разработанного дифференцируемого слоя скрытой марковской модели. Все последовательности и их эмбеддинги совместно выравниваются относительно модели семейства белков. Модернизированный выравниватель на основе скрытой марковской модели learnMSA2 в сочетании с языковой моделью белков ProtT5-XL в среднем корректно выравнивает почти на 6 процентных пунктов больше столбцов, чем лучший конкурентный метод, основанный на аминокислотных данных, и хорошо масштабируется при увеличении числа последовательностей. Относительное преимущество learnMSA2 перед другими программами, как правило, возрастает при снижении идентичности последовательностей и увеличении их числа. Полученные результаты усиливают доказательства того, что эмбеддинги языковых моделей белков содержат богатую информацию и способны оказывать существенное влияние на последующий анализ в биоинформатике.

Доступность и реализация: https://github.com/Gaius-Augustus/learnMSA, PyPI и Bioconda; оценка: https://github.com/felbecker/snakeMSA.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.