Точность коммерческой большой языковой модели ChatGPT при проведении сортировки смоделированных пациентов при катастрофах по протоколу простой сортировки и быстрого лечения (START): исследование повторяемости и воспроизводимости измерений
Accuracy of a Commercial Large Language Model (ChatGPT) to Perform Disaster Triage of Simulated Patients Using the Simple Triage and Rapid Treatment (START) Protocol: Gage Repeatability and Reproducibility Study
Аннотация
Введение: Выпуск ChatGPT (OpenAI) в ноябре 2022 года резко снизил порог доступа к искусственному интеллекту, предоставив простой веб-интерфейс на основе текста для работы с большой языковой моделью. Одним из возможных применений ChatGPT может быть сортировка пострадавших на месте катастрофы по протоколу простой сортировки и быстрого лечения (START). Однако для больших языковых моделей характерны некоторые распространённые ошибки, включая галлюцинации (также называемые конфабуляциями) и зависимость от формулировки запроса.
Цель: Оценить, может ли ChatGPT адекватно проводить сортировку смоделированных пострадавших при катастрофах по протоколу START, по трём показателям: повторяемости, воспроизводимости и точности.
Методы: Пять врачей медицины катастроф разработали девять запросов. С помощью скрипта на Python в ChatGPT версии 4 направляли каждый запрос в сочетании с 391 валидированным смоделированным описанием клинического случая. Каждую комбинацию воспроизводили 10 раз, всего было выполнено 35 190 смоделированных сортировок. Эталонную категорию сортировки START для каждого случая определяли два специалиста по медицине катастроф (JMF и MV); при расхождении их оценок привлекали третьего специалиста (LC). Результаты оценивали с помощью исследования повторяемости и воспроизводимости измерений (Gage R&R). Повторяемость определяли как вариабельность, обусловленную многократным использованием одного и того же запроса. Воспроизводимость определяли как вариабельность, обусловленную использованием разных запросов для одного и того же описания случая. Точность определяли как соответствие эталонному результату.
Результаты: В 35 102 случаях (99,7%) в ответ на запрос была получена допустимая категория START, однако вариабельность результатов была значительной. Повторяемость (многократное использование одного и того же запроса) составляла 14% общей вариабельности. Воспроизводимость (использование разных запросов) составляла 4,1% общей вариабельности. Точность ChatGPT при сортировке по START составила 63,9%; частота избыточной сортировки — 32,9%, недостаточной сортировки — 3,1%. Точность зависела от формулировки запроса: максимальная составила 71,8%, минимальная — 46,7%.
Выводы: ChatGPT версии 4 недостаточно надёжен для сортировки смоделированных пострадавших при катастрофах по протоколу START. Он продемонстрировал неоптимальные повторяемость и воспроизводимость, а общая точность сортировки составила лишь 63,9%. Медицинским работникам рекомендуется соблюдать осторожность при использовании коммерческих больших языковых моделей для принятия жизненно важных медицинских решений, поскольку такие инструменты могут часто генерировать неточные данные, которые принято называть галлюцинациями или конфабуляциями. Перед внедрением в клиническую практику инструменты на основе искусственного интеллекта должны проходить строгую статистическую оценку, в том числе с применением методов Gage R&R.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.