Расширение приближённых байесовских вычислений с помощью обучения с учителем для восстановления демографической истории по генетическим полиморфизмам с использованием DIYABC Random Forest
Extending approximate Bayesian computation with supervised machine learning to infer demographic history from genetic polymorphisms using DIYABC Random Forest
Аннотация
Методы, основанные на моделировании, такие как приближённые байесовские вычисления (ABC), хорошо подходят для анализа сложных сценариев генетической истории популяций и видов. В этом контексте методы обучения с учителем предлагают эффективные статистические решения для выбора сценария и оценки параметров. Метод случайного леса (RF) представляет собой мощный ансамбль алгоритмов обучения с учителем, применяемых для решения задач классификации и регрессии. Случайный лес позволяет проводить статистический вывод при низких вычислительных затратах, без предварительного отбора информативных компонентов сводной статистики ABC и без определения уровней допуска ABC. Мы реализовали набор алгоритмов RF для проведения статистического вывода на основе смоделированных наборов данных, полученных с помощью расширенной версии симулятора популяционной генетики, реализованного в DIYABC v2.1.0. Созданный компьютерный пакет DIYABC Random Forest v1.0 объединяет в удобном пользовательском интерфейсе две функциональные возможности: моделирование различных типов молекулярных данных — микросателлитов, последовательностей ДНК или SNP — по заданным эволюционным сценариям и обработку данных методами RF, включая статистические инструменты для оценки мощности и точности вывода. Возможности DIYABC Random Forest v1.0 для выбора сценария и оценки параметров продемонстрированы на анализе псевдонаблюдаемых и реальных наборов данных по SNP, полученных при пуловом и индивидуальном секвенировании. Благодаря свойствам реализованных методов RF и большому вектору признаков, доступному для данных SNP и включающему различные сводные статистики и их линейные комбинации, DIYABC Random Forest v1.0 может эффективно применяться для анализа больших наборов данных по SNP и восстановления сложной истории популяций.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.