Научная статья

pixy: несмещённая оценка нуклеотидного разнообразия и дивергенции при наличии пропущенных данных

pixy: Unbiased estimation of nucleotide diversity and divergence in the presence of missing data

Molecular Ecology Resources
10.1111/1755-0998.13326
Полный текст Открыть в журнале PubMed PMC
FWCI: 56.8FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 705 · Ссылки: 33 · Лицензия: Закрытая
Цитирование по годам: 2026: 148 · 2025: 203 · 2024: 163 · 2023: 115 · 2022: 71

Аннотация

В популяционно-генетических исследованиях для описания закономерностей генетической изменчивости и понимания эволюционных процессов часто используют сводные статистики. К наиболее фундаментальным из них относятся π и d, характеризующие генетическое разнообразие внутри популяций и дивергенцию между популяциями соответственно. В настоящей работе рассматривается широко распространённая проблема, возникающая при расчёте π и d: систематическое смещение, обусловленное пропущенными данными разных типов. Многие популярные методы расчёта π и d работают с данными, представленными в формате VCF, который сокращает объём генетических данных за счёт исключения неизменяющихся сайтов. При расчёте π и d по данным VCF часто неявно предполагается, что пропущенные генотипы, включая генотипы в сайтах, отсутствующих в VCF, являются гомозиготными по референсному аллелю. Мы показываем, что это предположение может приводить к существенному занижению оценок π и d, прямо пропорциональному объёму пропущенных данных. Мы обсуждаем распространённость и значение этой проблемы для популяционной генетики и представляем удобную утилиту pixy для командной строки UNIX, которая решает эту проблему с помощью алгоритма, генерирующего несмещённые оценки π и d при наличии пропущенных данных. Мы сравниваем pixy с существующими методами на симулированных и эмпирических данных и показываем, что только pixy позволяет получать несмещённые оценки π и d независимо от типа и объёма пропущенных данных. Таким образом, наше программное обеспечение решает давнюю проблему прикладной популяционной генетики и подчёркивает важность корректного учёта пропущенных данных при проведении популяционно-генетических анализов.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.