Научная статья

Оценка качества клинических записей, созданных ИИ: валидированная оценка фонового помощника для медицинской документации на основе большой языковой модели

Assessing the quality of AI-generated clinical notes: validated evaluation of a large language model ambient scribe

Frontiers in Artificial Intelligence
10.3389/frai.2025.1691499
Полный текст Открыть в журнале PubMed PMC
FWCI: 11.0FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 45 · Ссылки: 26 · Лицензия: CC-BY
Цитирование по годам: 2026: 34 · 2025: 4

Аннотация

Введение: Генеративные инструменты на основе искусственного интеллекта (ИИ) всё чаще используют в качестве «фоновых помощников» для подготовки проектов клинических записей по итогам приёма пациентов. Несмотря на быстрое внедрение, лишь в немногих исследованиях качество документации, созданной ИИ, систематически оценивали по сравнению со стандартами, принятыми у врачей, с использованием валидированных инструментов.

Цель: Сравнить качество клинических записей, созданных большой языковой моделью (LLM; «Ambient»), с эталонными записями, составленными врачами («Gold»), в пяти медицинских специальностях с использованием валидированного инструмента оценки качества врачебной документации PDQI-9.

Методы: В исследование включили 97 обезличенных аудиозаписей амбулаторных приёмов по общей медицине, педиатрии, акушерству и гинекологии, ортопедии и кардиологии взрослых. Для каждого приёма на основании исключительно аудиозаписи и соответствующей расшифровки создавали два варианта клинической записи: подготовленную с помощью оптимизированной для LLM системы «Ambient» и составленную врачом без доступа к результатам другой системы — эталонную запись «Gold». Два эксперта соответствующих специальностей, не знавшие о способе подготовки записей, независимо оценивали каждую из них с помощью модифицированного PDQI-9, включавшего 11 критериев, оцениваемых по шкале Лайкерта, а также бинарную оценку наличия галлюцинаций. Межэкспертную надёжность оценивали с использованием коэффициента межэкспертного согласия внутри групп (RWG). Парные сравнения выполняли с помощью t-критерия или критерия Манна—Уитни.

Результаты: При парном анализе 97 клинических приёмов получили 194 записи (по 2 на каждый приём) и 388 парных оценок. В целом межэкспертное согласие было высоким (RWG > 0,7), однако в педиатрии и кардиологии отмечалось умеренное соответствие оценок. Эталонные записи «Gold» имели более высокие общие баллы качества (4,25/5 против 4,20/5; p = 0,04), а также превосходили записи «Ambient» по точности (p = 0,05), лаконичности (p < 0,001) и внутренней согласованности (p = 0,004). В то же время записи «Ambient» получили более высокие оценки за полноту (p < 0,001) и структурированность (p = 0,03). Галлюцинации выявили в 20% эталонных записей «Gold» и в 31% записей «Ambient» (p = 0,01). Несмотря на эти ограничения, эксперты в целом чаще отдавали предпочтение записям «Ambient» (47% против 39% для записей «Gold»).

Выводы: Качество клинических записей «Ambient», созданных LLM, было сопоставимо с качеством записей, составленных врачами, в разных медицинских специальностях. Записи «Ambient» отличались большей полнотой и лучшей структурированностью, но были менее лаконичными и чаще содержали галлюцинации. PDQI-9 представляет собой валидированный практический инструмент для оценки клинической документации, созданной ИИ. Данная методика оценки качества может использоваться для поэтапной оптимизации таких систем и стандартизации применения фоновых ИИ-помощников в клинической практике.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.