Оценка качества клинических записей, созданных ИИ: валидированная оценка фонового помощника для медицинской документации на основе большой языковой модели
Assessing the quality of AI-generated clinical notes: validated evaluation of a large language model ambient scribe
Аннотация
Введение: Генеративные инструменты на основе искусственного интеллекта (ИИ) всё чаще используют в качестве «фоновых помощников» для подготовки проектов клинических записей по итогам приёма пациентов. Несмотря на быстрое внедрение, лишь в немногих исследованиях качество документации, созданной ИИ, систематически оценивали по сравнению со стандартами, принятыми у врачей, с использованием валидированных инструментов.
Цель: Сравнить качество клинических записей, созданных большой языковой моделью (LLM; «Ambient»), с эталонными записями, составленными врачами («Gold»), в пяти медицинских специальностях с использованием валидированного инструмента оценки качества врачебной документации PDQI-9.
Методы: В исследование включили 97 обезличенных аудиозаписей амбулаторных приёмов по общей медицине, педиатрии, акушерству и гинекологии, ортопедии и кардиологии взрослых. Для каждого приёма на основании исключительно аудиозаписи и соответствующей расшифровки создавали два варианта клинической записи: подготовленную с помощью оптимизированной для LLM системы «Ambient» и составленную врачом без доступа к результатам другой системы — эталонную запись «Gold». Два эксперта соответствующих специальностей, не знавшие о способе подготовки записей, независимо оценивали каждую из них с помощью модифицированного PDQI-9, включавшего 11 критериев, оцениваемых по шкале Лайкерта, а также бинарную оценку наличия галлюцинаций. Межэкспертную надёжность оценивали с использованием коэффициента межэкспертного согласия внутри групп (RWG). Парные сравнения выполняли с помощью t-критерия или критерия Манна—Уитни.
Результаты: При парном анализе 97 клинических приёмов получили 194 записи (по 2 на каждый приём) и 388 парных оценок. В целом межэкспертное согласие было высоким (RWG > 0,7), однако в педиатрии и кардиологии отмечалось умеренное соответствие оценок. Эталонные записи «Gold» имели более высокие общие баллы качества (4,25/5 против 4,20/5; p = 0,04), а также превосходили записи «Ambient» по точности (p = 0,05), лаконичности (p < 0,001) и внутренней согласованности (p = 0,004). В то же время записи «Ambient» получили более высокие оценки за полноту (p < 0,001) и структурированность (p = 0,03). Галлюцинации выявили в 20% эталонных записей «Gold» и в 31% записей «Ambient» (p = 0,01). Несмотря на эти ограничения, эксперты в целом чаще отдавали предпочтение записям «Ambient» (47% против 39% для записей «Gold»).
Выводы: Качество клинических записей «Ambient», созданных LLM, было сопоставимо с качеством записей, составленных врачами, в разных медицинских специальностях. Записи «Ambient» отличались большей полнотой и лучшей структурированностью, но были менее лаконичными и чаще содержали галлюцинации. PDQI-9 представляет собой валидированный практический инструмент для оценки клинической документации, созданной ИИ. Данная методика оценки качества может использоваться для поэтапной оптимизации таких систем и стандартизации применения фоновых ИИ-помощников в клинической практике.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.