Научная статья

Эмбеддинги языковых моделей белков предсказывают консервативность и эффекты вариантов

Embeddings from protein language models predict conservation and variant effects

Human Genetics
10.1007/s00439-021-02411-y
Полный текст Открыть в журнале PubMed PMC
FWCI: 7.99FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 158 · Ссылки: 94 · Лицензия: CC-BY
Цитирование по годам: 2026: 25 · 2025: 45 · 2024: 44 · 2023: 45 · 2022: 17

Аннотация

Появление вариантов SARS-CoV-2 повысило потребность в инструментах для оценки влияния вариантов одной аминокислоты (SAV) на функцию белка. Хотя наборы данных глубокого сканирования мутаций (DMS) продолжают расширять наши представления о мутационном ландшафте отдельных белков, их результаты по-прежнему затрудняют анализ. Языковые модели белков (pLM) используют современные алгоритмы глубокого обучения (DL) и растущие базы данных белковых последовательностей. Эти методы обучаются предсказывать отсутствующие или маскированные аминокислоты по контексту всей области последовательности. В настоящем исследовании мы использовали представления pLM (эмбеддинги) для предсказания консервативности последовательностей и эффектов SAV без множественного выравнивания последовательностей (MSA). Одни только эмбеддинги предсказывали консервативность остатков почти с такой же точностью по одиночным последовательностям, как ConSeq с использованием MSA: двухклассовый коэффициент корреляции Мэтьюса (MCC) для эмбеддингов ProtT5 составил 0,596 ± 0,006 против 0,608 ± 0,006 для ConSeq. При подаче предсказания консервативности вместе с показателями замен BLOSUM62 и вероятностями восстановления маски, рассчитанными pLM, в простую ансамблевую логистическую регрессию для предсказания эффектов вариантов без выравнивания (VESPA) удалось предсказать величину эффекта SAV без какой-либо оптимизации на данных DMS. Сравнение предсказаний в стандартном наборе из 39 экспериментов DMS с другими методами, включая ESM-1v, DeepSequence и GEMME, показало, что наш подход сопоставим с современными методами, использующими MSA. Ни один метод не превосходил остальные во всех случаях — ни стабильно, ни статистически значимо, независимо от применяемой метрики эффективности (корреляции Спирмена и Пирсона). Наконец, мы исследовали бинарные предсказания эффектов в экспериментах DMS для четырех белков человека. В целом методы на основе эмбеддингов стали сопоставимы с методами, использующими MSA, при значительно меньших затратах вычислительных ресурсов и энергии. Наш метод предсказал эффекты SAV для всего протеома человека (около 20 000 белков) за 40 минут на одном графическом процессоре Nvidia Quadro RTX 8000. Все методы и наборы данных доступны бесплатно для локального и онлайн-использования через bioembeddings.com, https://github.com/Rostlab/VESPA и PredictProtein.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.