Результаты генеративных больших языковых моделей при ответах на вопросы по офтальмологии в формате аттестационных заданий
Performance of Generative Large Language Models on Ophthalmology Board-Style Questions
Аннотация
Цель: Оценить способность моделей генеративного искусственного интеллекта отвечать на вопросы по офтальмологии в формате аттестационных заданий.
Дизайн: Экспериментальное исследование.
Методы: Оценивали 3 большие языковые модели с чат-интерфейсами: Bing Chat (Microsoft), ChatGPT 3.5 и ChatGPT 4.0 (OpenAI), используя 250 вопросов из Программы самооценки по фундаментальным и клиническим наукам. Несмотря на то что ChatGPT обучен на данных, последнее обновление которых датируется 2021 годом, Bing Chat использует для формирования ответов более современный поиск по индексированным интернет-ресурсам. Результаты сравнивали с ответами людей. Вопросы классифицировали по сложности и этапу оказания медицинской помощи; также фиксировали случаи выдумывания информации и нелогичных рассуждений.
Основные оцениваемые показатели: Первичным показателем была точность ответов. Вторичными показателями были результаты в отдельных категориях вопросов и частота галлюцинаций.
Результаты: Средняя точность ответов людей составила 72,2%. Наименьший результат показала ChatGPT-3.5 (58,8%), тогда как показатели ChatGPT-4.0 (71,6%) и Bing Chat (71,2%) были сопоставимыми. По сравнению с диагностическими вопросами ChatGPT-4.0 лучше отвечала на вопросы, требующие выбора тактики обследования (отношение шансов [ОШ] 3,89; 95% доверительный интервал [ДИ] 1,19–14,73; P = 0,03), но хуже справлялась с интерпретацией изображений (ОШ 0,14; 95% ДИ 0,05–0,33; P < 0,01), чем с вопросами, требующими рассуждений в один этап. По сравнению с одноэтапными вопросами Bing Chat также хуже справлялась с интерпретацией изображений (ОШ 0,18; 95% ДИ 0,08–0,44; P < 0,01) и многоэтапными рассуждениями (ОШ 0,30; 95% ДИ 0,11–0,84; P = 0,02). Наиболее высокая частота галлюцинаций и нелогичных рассуждений отмечалась у ChatGPT-3.5 (42,4%), затем у Bing Chat (25,6%) и ChatGPT-4.0 (18,0%).
Выводы: Большие языковые модели, особенно ChatGPT-4.0 и Bing Chat, могут демонстрировать результаты, сопоставимые с результатами людей при ответах на вопросы из Программы самооценки по фундаментальным и клиническим наукам. Частота галлюцинаций и нелогичных рассуждений указывает на необходимость дальнейшего совершенствования разговорных систем в медицинской сфере.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.