Научная статья

ChatGPT не сдал экзамен по семейной медицине на Тайване

ChatGPT failed Taiwan's Family Medicine Board Exam

Journal of the Chinese Medical Association : JCMA
10.1097/JCMA.0000000000000946
Полный текст Открыть в журнале PubMed PMC
FWCI: 3.28FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 95 · Ссылки: 19 · Лицензия: CC-BY-NC-ND
Цитирование по годам: 2026: 4 · 2025: 24 · 2024: 67 · 2023: 14

Аннотация

Введение: Chat Generative Pre-trained Transformer (ChatGPT; OpenAI Limited Partnership, Сан-Франциско, Калифорния, США) — языковая модель искусственного интеллекта, которая становится всё более популярной благодаря обширной базе данных и способности интерпретировать различные запросы и отвечать на них. Хотя исследователи уже оценивали её возможности в разных областях, результаты зависят от предметной области. Целью настоящего исследования была дополнительная оценка возможностей ChatGPT в медицине.

Методы: Использовали вопросы экзаменационной работы 2022 года для получения сертификата специалиста по семейной медицине на Тайване. Экзамен включал вопросы на китайском и английском языках различных типов, в том числе вопросы с отрицательной формулировкой и вопросы с выбором одного ответа, и был посвящён главным образом общим медицинским знаниям. Каждый вопрос вводили в ChatGPT и регистрировали полученный ответ, сопоставляя его с правильным ответом, предоставленным экзаменационной комиссией. С помощью SAS 9.4 (Кэри, Северная Каролина, США) и Excel рассчитывали точность ответов для каждого типа вопросов.

Результаты: ChatGPT правильно ответил на 52 из 125 вопросов; точность составила 41,6%. Длина вопросов не влияла на точность ответов. Точность составила 45,5% для вопросов с отрицательной формулировкой, 33,3% — для вопросов с выбором одного ответа, 58,3% — для вопросов с взаимоисключающими вариантами ответа, 50,0% — для ситуационных задач и 43,5% — для вопросов, связанных с местной политикой Тайваня; статистически значимых различий не выявлено.

Выводы: Точность ответов ChatGPT оказалась недостаточной для успешной сдачи экзамена по семейной медицине на Тайване. Возможными причинами являются сложность специализированного экзамена и относительно небольшой объём ресурсов на традиционном китайском языке. Вместе с тем ChatGPT продемонстрировал приемлемые результаты при ответах на вопросы с отрицательной формулировкой, вопросы с взаимоисключающими вариантами ответа и ситуационные задачи, поэтому может быть полезен для обучения и подготовки к экзаменам. В дальнейших исследованиях можно изучить способы повышения точности ChatGPT при специализированных экзаменах и в других предметных областях.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.