Оценка эффективности ChatGPT как инструмента обучения пациентов при раке предстательной железы: многокритериальная оценка
Evaluating the Efficacy of ChatGPT as a Patient Education Tool in Prostate Cancer: Multimetric Assessment
Аннотация
Введение: Чат-боты на основе искусственного интеллекта (ИИ), такие как ChatGPT, достигли значительного прогресса. Эти чат-боты, особенно популярные среди медицинских работников и пациентов, меняют подходы к обучению пациентов и восприятию заболевания, предоставляя персонализированную информацию. Точное и своевременное информирование пациентов имеет решающее значение для принятия обоснованных решений, особенно в отношении скрининга с определением простат-специфического антигена и вариантов лечения. Однако точность и надёжность медицинской информации, предоставляемой чат-ботами на основе ИИ, требуют тщательной оценки. Появляются исследования, посвящённые проверке знаний ChatGPT о раке предстательной железы, однако необходима постоянная оценка, чтобы обеспечивать качество и безопасность информации для пациентов.
Цель: Оценить качество, точность и удобочитаемость ответов ChatGPT-4 на распространённые вопросы пациентов о раке предстательной железы.
Методы: Всего было сформулировано 8 вопросов с использованием индуктивного подхода на основе тем, представленных в рецензируемой литературе, и данных Google Trends. Четыре независимых эксперта оценивали качество ответов ИИ с помощью адаптированных версий инструментов Patient Education Materials Assessment Tool for AI (PEMAT-AI), Global Quality Score и DISCERN-AI. Восемь ответов ИИ оценили 7 экспертов-урологов по разработанной системе критериев, включавшей точность, безопасность, уместность, применимость и эффективность. Удобочитаемость ответов оценивали с помощью общепринятых алгоритмов: индекса удобочитаемости Флеша, индекса туманности Ганнинга, уровня образования по Флешу—Кинкейду, индекса Коулмана—Лиау и индекса SMOG (Simple Measure of Gobbledygook). Для анализа источников, указанных в ответах ИИ, был разработан краткий инструмент Reference Assessment AI (REF-AI), оценивавший наличие галлюцинаций в ссылках, а также их релевантность и качество.
Результаты: Средняя оценка понятности по PEMAT-AI была очень хорошей и составила 79,44% (SD 10,44%), оценка по DISCERN-AI соответствовала хорошему качеству (среднее 13,88; SD 0,93), а средняя оценка по Global Quality Score была высокой — 4,46 из 5 (SD 0,50). Средние совокупные оценки по инструменту Natural Language Assessment Tool for AI составили: точность — 3,96 (SD 0,91), безопасность — 4,32 (SD 0,86), уместность — 4,45 (SD 0,81), применимость — 4,05 (SD 1,15), эффективность — 4,09 (SD 0,98). Согласно совокупной оценке алгоритмов удобочитаемости, текст был «труден для чтения»: средняя оценка по индексу удобочитаемости Флеша составила 45,97 (SD 8,69), по индексу туманности Ганнинга — 14,55 (SD 4,79). В среднем уровень сложности соответствовал 11-му классу, то есть возрасту 15–17 лет: уровень образования по Флешу—Кинкейду — 12,12 (SD 4,34), индекс Коулмана—Лиау — 12,75 (SD 1,98), индекс SMOG — 11,06 (SD 3,20). С помощью REF-AI были выявлены 2 галлюцинации в ссылках, тогда как большинство источников (28 из 30; 93%) надлежащим образом дополняли текст. Большинство ссылок (26 из 30; 86%) вело на авторитетные сайты государственных организаций; лишь небольшая часть представляла собой прямые ссылки на научные публикации.
Выводы: Проведённый анализ показал, что ChatGPT-4 в целом даёт хорошие ответы на распространённые вопросы о раке предстательной железы и потенциально может быть полезен для обучения пациентов в рамках помощи при этом заболевании. Объективная оценка качества показала, что ответы, сформированные с использованием обработки естественного языка, в целом надёжны и уместны, однако требуют дальнейшего совершенствования.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.