Анализ классификации последовательностей ДНК с использованием сверточных и гибридных моделей
Analysis of DNA Sequence Classification Using CNN and Hybrid Models
Аннотация
В общем контексте вычислительного анализа биомедицинских данных классификация последовательностей ДНК представляет собой важную задачу. В последние годы для её решения успешно применялись различные методы машинного обучения. Выявление и классификация вирусов имеют ключевое значение для предотвращения вспышек инфекций, подобных COVID-19. При этом отбор признаков остаётся наиболее сложным аспектом задачи. Наиболее распространённые способы представления данных усугубляют проблему высокой размерности, а последовательности не содержат явных признаков. Классификация также помогает выявлять эффекты воздействия вирусов и разрабатывать лекарственные средства. В последнее время модели глубокого обучения способны автоматически извлекать признаки из входных данных. В настоящей работе для классификации последовательностей ДНК использовали архитектуры CNN, CNN–LSTM и CNN с двунаправленной LSTM, применяя кодирование метками и k-мерное кодирование. Модели оценивали по различным метрикам классификации. По результатам экспериментов, на тестовых данных точность моделей CNN и CNN с двунаправленной LSTM при k-мерном кодировании составила 93,16 и 93,13% соответственно.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.