Диагностическая эффективность больших языковых моделей в детском отделении неотложной помощи: пилотное исследование
Diagnostic efficacy of large language models in the pediatric emergency department: a pilot study
Аннотация
Введение: Работа детского отделения неотложной помощи (ДОП) сопряжена со значительными трудностями: большим потоком пациентов, необходимостью принимать решения в сжатые сроки и сложностью диагностики. Большие языковые модели (LLM) могут улучшить оказание медицинской помощи, однако их эффективность в поддержке диагностического процесса остаётся неопределённой, а результаты исследований влияния таких моделей на клиническое мышление противоречивы. Целью исследования было оценить эффективность чат-ботов на основе LLM в реалистичных ситуациях, возникающих в ДОП, и изучить возможность их использования в качестве помощников при постановке диагноза в детской неотложной помощи.
Методы: Проведено сравнение диагностической эффективности 5 LLM (ChatGPT-4o, Gemini 1.5 Pro, Gemini 1.5 Flash, Llama-3-8B и ChatGPT-4o mini) и 23 врачей, включая 10 врачей ДОП, 6 ординаторов ДОП и 7 ординаторов по неотложной медицине. И LLM, и врачи должны были указать один основной и два дифференциальных диагноза для 80 реальных клинических случаев из практики ДОП многопрофильной детской больницы третичного уровня; случаи относились к трём уровням диагностической сложности. Ответы LLM и врачей сравнивали с окончательными диагнозами, установленными при выписке пациентов. Два независимых эксперта оценивали ответы по пятиуровневой шкале точности. Каждый врач или LLM получал суммарную оценку из 80 баллов, рассчитанную как сумма баллов за все ответы.
Результаты: Наилучшие результаты показали ChatGPT-4o (72,5 балла) и Gemini 1.5 Pro (62,75 балла); результат ChatGPT-4o был выше, чем у врачей ДОП (61,88 балла; p < 0,05). Ординаторы по неотложной медицине набрали меньше баллов (43,75), чем остальные врачи и чат-боты (p < 0,01). Эффективность чат-ботов снижалась с увеличением сложности случаев, однако ChatGPT-4o сохранял большинство правильных ответов даже при высокой сложности.
Обсуждение: ChatGPT-4o и Gemini 1.5 Pro могут стать полезными инструментами для врачей отделений неотложной помощи, поддерживая принятие клинических решений, но не заменяя врачебное суждение. Необходимы единые протоколы эффективного взаимодействия чат-ботов на основе искусственного интеллекта и медицинских работников.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.