Научная статья

Результаты генеративных больших языковых моделей при ответах на вопросы по офтальмологии в формате аттестационных заданий

Performance of Generative Large Language Models on Ophthalmology Board-Style Questions

American Journal of Ophthalmology
10.1016/j.ajo.2023.05.024
Открыть в журнале PubMed
FWCI: 4.06FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 134 · Ссылки: 20 · Лицензия: Закрытая
Цитирование по годам: 2026: 14 · 2025: 44 · 2024: 62 · 2023: 19

Аннотация

Цель: Оценить способность моделей генеративного искусственного интеллекта отвечать на вопросы по офтальмологии в формате аттестационных заданий.

Дизайн: Экспериментальное исследование.

Методы: Оценивали 3 большие языковые модели с чат-интерфейсами: Bing Chat (Microsoft), ChatGPT 3.5 и ChatGPT 4.0 (OpenAI), используя 250 вопросов из Программы самооценки по фундаментальным и клиническим наукам. Несмотря на то что ChatGPT обучен на данных, последнее обновление которых датируется 2021 годом, Bing Chat использует для формирования ответов более современный поиск по индексированным интернет-ресурсам. Результаты сравнивали с ответами людей. Вопросы классифицировали по сложности и этапу оказания медицинской помощи; также фиксировали случаи выдумывания информации и нелогичных рассуждений.

Основные оцениваемые показатели: Первичным показателем была точность ответов. Вторичными показателями были результаты в отдельных категориях вопросов и частота галлюцинаций.

Результаты: Средняя точность ответов людей составила 72,2%. Наименьший результат показала ChatGPT-3.5 (58,8%), тогда как показатели ChatGPT-4.0 (71,6%) и Bing Chat (71,2%) были сопоставимыми. По сравнению с диагностическими вопросами ChatGPT-4.0 лучше отвечала на вопросы, требующие выбора тактики обследования (отношение шансов [ОШ] 3,89; 95% доверительный интервал [ДИ] 1,19–14,73; P = 0,03), но хуже справлялась с интерпретацией изображений (ОШ 0,14; 95% ДИ 0,05–0,33; P < 0,01), чем с вопросами, требующими рассуждений в один этап. По сравнению с одноэтапными вопросами Bing Chat также хуже справлялась с интерпретацией изображений (ОШ 0,18; 95% ДИ 0,08–0,44; P < 0,01) и многоэтапными рассуждениями (ОШ 0,30; 95% ДИ 0,11–0,84; P = 0,02). Наиболее высокая частота галлюцинаций и нелогичных рассуждений отмечалась у ChatGPT-3.5 (42,4%), затем у Bing Chat (25,6%) и ChatGPT-4.0 (18,0%).

Выводы: Большие языковые модели, особенно ChatGPT-4.0 и Bing Chat, могут демонстрировать результаты, сопоставимые с результатами людей при ответах на вопросы из Программы самооценки по фундаментальным и клиническим наукам. Частота галлюцинаций и нелогичных рассуждений указывает на необходимость дальнейшего совершенствования разговорных систем в медицинской сфере.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.