Глубокое представление и выравнивание белковых последовательностей
Deep embedding and alignment of protein sequences
Аннотация
Выравнивание белковых последовательностей — ключевой компонент большинства биоинформатических конвейеров, предназначенных для изучения структуры и функций белков. Однако выравнивание сильно дивергировавших последовательностей остаётся сложной задачей: современные алгоритмы часто выполняют его недостаточно точно, из-за чего многие белки или открытые рамки считывания получают неполную или неточную аннотацию. Используя последние достижения глубокого обучения языковому моделированию и дифференцируемого программирования, мы разработали DEDAL (deep embedding and differentiable alignment — глубокое представление и дифференцируемое выравнивание) — гибкую модель для выравнивания белковых последовательностей и выявления гомологов. DEDAL — модель на основе машинного обучения, которая учится выравнивать последовательности на больших наборах исходных белковых последовательностей и корректных выравниваний. После обучения DEDAL повышала точность выравнивания отдалённых гомологов в 2–3 раза по сравнению с существующими методами и лучше отличала отдалённых гомологов от эволюционно неродственных последовательностей, создавая возможности для совершенствования многих последующих задач структурной и функциональной геномики, основанных на выравнивании последовательностей.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.