learnMSA2: глубокое множественное выравнивание белковых последовательностей с использованием больших языковых моделей и скрытых марковских моделей
learnMSA2: deep protein multiple alignments with large language and hidden Markov models
Аннотация
Обоснование: Для выравнивания большого числа белковых последовательностей преимущественно используют инструменты, которые решают, следует ли сопоставлять две аминокислоты, основываясь лишь на простых априорных знаниях, например матрицах замен аминокислот, и используют только часть доступных данных. Точность современных программ снижается при уменьшении идентичности последовательностей и увеличении их числа. Недавно трансформерные модели глубокого обучения начали использовать огромный объём данных о белковых последовательностях, что привело к появлению мощных предварительно обученных языковых моделей, предназначенных главным образом для формирования высокоразмерных числовых представлений отдельных позиций — эмбеддингов, объединяющих эволюционную, структурную и биофизическую информацию.
Результаты: Мы расширили традиционную профильную скрытую марковскую модель, добавив возможность подавать на вход невыравненные белковые последовательности и соответствующие им эмбеддинги. Обучение модели выполняли методом градиентного спуска с использованием ранее разработанного дифференцируемого слоя скрытой марковской модели. Все последовательности и их эмбеддинги совместно выравниваются относительно модели семейства белков. Модернизированный выравниватель на основе скрытой марковской модели learnMSA2 в сочетании с языковой моделью белков ProtT5-XL в среднем корректно выравнивает почти на 6 процентных пунктов больше столбцов, чем лучший конкурентный метод, основанный на аминокислотных данных, и хорошо масштабируется при увеличении числа последовательностей. Относительное преимущество learnMSA2 перед другими программами, как правило, возрастает при снижении идентичности последовательностей и увеличении их числа. Полученные результаты усиливают доказательства того, что эмбеддинги языковых моделей белков содержат богатую информацию и способны оказывать существенное влияние на последующий анализ в биоинформатике.
Доступность и реализация: https://github.com/Gaius-Augustus/learnMSA, PyPI и Bioconda; оценка: https://github.com/felbecker/snakeMSA.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.