Интерпретируемый метод обучения на множестве экземпляров для точной дифференциации злокачественных и доброкачественных поражений гортани при ларингоскопии
An interpretable multi-instance learning method for accurate differentiation of malignant and benign laryngeal lesions in laryngoscopy
Аннотация
Введение: Рак гортани представляет собой значимую глобальную проблему здравоохранения и характеризуется высокой летальностью; ранняя диагностика имеет критическое значение для выживаемости пациентов. Разработка точных диагностических моделей для ларингоскопии может снизить необходимость повторных биопсий и уменьшить нагрузку на пациента, что представляет собой актуальную клиническую потребность. Однако существующие модели искусственного интеллекта часто работают по принципу «чёрного ящика» и обучаются на отдельных предварительно отобранных изображениях, что не соответствует клинической практике, в которой оценивают множество изображений.
Методы: Проведено ретроспективное исследование с участием 611 пациентов, которым выполняли эндоскопию в белом свете (WLE). Разработана интерпретируемая сеть обучения на множестве экземпляров (IMIL-Net), использующая набор изображений на уровне пациента. Модель включает кодировщик Swin Transformer и механизм объединения с регулируемым вниманием, что позволяет формировать диагноз на уровне пациента и оценки интерпретируемости для отдельных изображений. Модель оценивали с помощью пятичастной перекрёстной проверки и сравнивали с четырьмя базовыми моделями. Интерпретируемость количественно оценивали путём сопоставления показателей внимания с областями интереса (ROI), размеченными врачами в 30 случаях, с использованием U-критерия Манна—Уитни.
Результаты: IMIL-Net продемонстрировала наилучшие диагностические характеристики: средняя площадь под ROC-кривой (AUC) составила 0,975 (95% ДИ 0,959–0,991), точность — 0,915 (95% ДИ 0,883–0,947), чувствительность — 0,876 (95% ДИ 0,803–0,949), специфичность — 0,945 (95% ДИ 0,910–0,980). Эти результаты превосходили показатели всех базовых моделей, включая архитектуры без обучения на множестве экземпляров (AUC 0,888–0,897) и модель логистической регрессии, использовавшую только клинические данные (AUC 0,898). Интерпретируемость модели также была количественно подтверждена: изображения с областями интереса, размеченными врачами (n=63), имели достоверно более высокий медианный показатель внимания — 20,94%, по сравнению с изображениями без таких областей (n=78; 15,32%; [формула: см. текст]).
Выводы: Предложенная IMIL-Net обеспечивает высокую точность, интерпретируемость и соответствие клинической практике при диагностике. Анализируя все изображения обследования пациента и предоставляя статистически подтверждемый процесс принятия решений, модель может служить надёжным инструментом для внедрения в клиническую практику оториноларингологии.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.