Научная статья

DNABERT: предварительно обученная двунаправленная модель кодировочного представления на основе трансформеров для языка ДНК в геноме

DNABERT: pre-trained Bidirectional Encoder Representations from Transformers model for DNA-language in genome

Bioinformatics (Oxford, England)
10.1093/bioinformatics/btab083
Полный текст Открыть в журнале PubMed PMC
FWCI: 46.2FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 1266 · Ссылки: 57 · Лицензия: Закрытая
Цитирование по годам: 2026: 294 · 2025: 424 · 2024: 307 · 2023: 188 · 2022: 76

Аннотация

Обоснование: Расшифровка языка некодирующей ДНК — одна из фундаментальных задач геномных исследований. Регуляторный код генов чрезвычайно сложен из-за многозначности и дальних семантических связей, которые существующие биоинформатические методы часто не способны уловить, особенно при дефиците данных.

Результаты: Для решения этой задачи мы разработали новую предварительно обученную модель двунаправленного кодировочного представления DNABERT, способную формировать глобальное и переносимое представление геномных последовательностей ДНК на основе контекстов вышележащих и нижележащих нуклеотидов. Мы сравнили DNABERT с наиболее широко используемыми программами для предсказания регуляторных элементов в масштабах всего генома и продемонстрировали простоту применения, точность и эффективность модели. Одна предварительно обученная модель трансформера после простого дообучения на небольшом объёме специфичных для задачи размеченных данных одновременно обеспечивает наилучшие современные результаты при предсказании промоторов, сайтов сплайсинга и сайтов связывания факторов транскрипции. Кроме того, DNABERT позволяет непосредственно визуализировать значимость отдельных нуклеотидов и семантические связи внутри входных последовательностей, что улучшает интерпретируемость и помогает точно выявлять консервативные мотивы последовательностей и кандидатов на функционально значимые генетические варианты. Наконец, мы показали, что DNABERT, предварительно обученная на геноме человека, может без дополнительной адаптации применяться к другим организмам, обеспечивая исключительно высокую эффективность. Мы предполагаем, что предварительно обученную модель DNABERT можно дообучать для решения многих других задач анализа последовательностей.

Доступность и реализация: Исходный код, а также предварительно обученная и дообученные модели DNABERT доступны на GitHub (https://github.com/jerryji1993/DNABERT).

Дополнительная информация: Дополнительные данные доступны онлайн на сайте журнала Bioinformatics.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.