Обзор

Что делает прогноз точным? Важность признаков и первые шаги к раскрытию «чёрного ящика» машинного обучения в генетике

What makes a good prediction? Feature importance and beginning to open the black box of machine learning in genetics

Human Genetics
10.1007/s00439-021-02402-z
Полный текст Открыть в журнале PubMed PMC
FWCI: 3.50FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 122 · Ссылки: 86 · Лицензия: CC-BY
Цитирование по годам: 2026: 25 · 2025: 62 · 2024: 25 · 2023: 18 · 2022: 3

Аннотация

За последнее десятилетие генетические данные стали значительно сложнее, что побудило исследователей обращаться к более сложным вопросам, включая эпистатические взаимодействия и предсказание свойств белков. Традиционные методы плохо подходят для решения таких задач, однако методы машинного обучения (МО) предлагают альтернативный подход. Алгоритмы МО широко применяют в генетике для прогнозирования или классификации объектов исследования, но некоторые методы позволяют оценить, какие признаки (переменные) обеспечивают точный прогноз; это называют важностью признаков. Для генетики данный подход имеет принципиальное значение, поскольку исследователей часто интересует, какие признаки — например, генотип по однонуклеотидному полиморфизму или воздействие факторов внешней среды — лежат в основе точного прогноза. Это позволяет выйти за рамки простого прогнозирования и классификации, в частности определить факторы риска, связанные с конкретным фенотипом. Оценка важности признаков также позволяет заглянуть внутрь «чёрного ящика» многих алгоритмов МО, понять принципы их работы и установить, какие признаки имеют решающее значение для точного прогноза. В этом обзоре рассматриваются методы МО, предоставляющие показатели важности признаков для анализа генетических данных. Описаны пять основных категорий алгоритмов МО: метод k ближайших соседей, искусственные нейронные сети, глубокое обучение, метод опорных векторов и случайные леса. В заключении обсуждается выбор наиболее подходящего алгоритма для конкретного набора данных. Обзор будет особенно полезен исследователям в области генетики, планирующим использовать методы МО для решения задач, выходящих за рамки базового прогнозирования и классификации.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.