Научная статья

Модель искусственного интеллекта GPT-4 превосходит ChatGPT, студентов-медиков и ординаторов-нейрохирургов при ответах на вопросы, аналогичные письменному сертификационному экзамену по нейрохирургии

GPT-4 Artificial Intelligence Model Outperforms ChatGPT, Medical Students, and Neurosurgery Residents on Neurosurgery Written Board-Like Questions

World Neurosurgery
10.1016/j.wneu.2023.08.042
Открыть в журнале PubMed
FWCI: 3.65FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 116 · Ссылки: 17 · Лицензия: Закрытая
Цитирование по годам: 2026: 7 · 2025: 58 · 2024: 53 · 2023: 7

Аннотация

Введение: Искусственный интеллект (ИИ) и машинное обучение преобразовали здравоохранение, найдя применение в различных специализированных областях. Нейрохирургия может использовать ИИ для планирования операций, прогнозирования исходов лечения и анализа данных нейровизуализации. GPT-4 — обновлённая языковая модель с дополнительными параметрами обучения — продемонстрировала выдающиеся результаты на стандартизированных экзаменах. В настоящем исследовании оценивали способность GPT-4 отвечать на вопросы, аналогичные экзаменационным вопросам по нейрохирургии, и сравнивали её результаты с показателями студентов-медиков и ординаторов, чтобы изучить потенциальные возможности применения модели в медицинском образовании и при принятии клинических решений.

Методы: Результаты GPT-4 оценивали по 643 вопросам, аналогичным экзаменационным вопросам Конгресса нейрохирургов — экзамена для самостоятельной оценки знаний по нейрохирургии (Self-Assessment Neurosurgery Exam, SANS), охватывавшим различные субспециальности нейрохирургии. Из них 477 вопросов содержали только текст, а 166 — изображения. GPT-4 отказалась отвечать на 52 вопроса, не содержавших текста. Оставшиеся 591 вопрос ввели в GPT-4; результаты оценивали по ответам с первой попытки. Необработанные баллы анализировали в разрезе субспециальностей и типов вопросов, а затем сравнивали с ранее опубликованными результатами ChatGPT, полученными при ответах на вопросы SANS, а также с показателями пользователей SANS, студентов-медиков и ординаторов-нейрохирургов.

Результаты: GPT-4 предприняла попытку ответить на 91,9% вопросов SANS Конгресса нейрохирургов и дала правильные ответы в 76,6% случаев. Для вопросов, содержащих только текст, точность повысилась до 79,0%. GPT-4 превзошла ChatGPT (P < 0,001); наилучший результат модель показала в категории «Боль и периферические нервы» (84%), а наихудший — в категории «Позвоночник» (73%). По всем категориям GPT-4 превзошла студентов-медиков (26,3%), ординаторов-нейрохирургов (61,5%) и средний показатель пользователей SANS по стране (69,3%).

Выводы: GPT-4 значительно превзошла студентов-медиков, ординаторов-нейрохирургов и средний показатель пользователей SANS по стране. Точность модели указывает на потенциальную возможность её применения в образовательных целях и при принятии клинических решений, что может повысить эффективность работы медицинских специалистов и улучшить оказание медицинской помощи.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.