Сравнительное исследование

Потенциал больших языковых моделей генеративного искусственного интеллекта для доказательной ортодонтии: сравнительное исследование ChatGPT, Google Bard и Microsoft Bing

Evidence-based potential of generative artificial intelligence large language models in orthodontics: a comparative study of ChatGPT, Google Bard, and Microsoft Bing

European Journal of Orthodontics
10.1093/ejo/cjae017
Полный текст Открыть в журнале PubMed PMC
FWCI: 9.36FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 107 · Ссылки: 33 · Лицензия: CC-BY
Цитирование по годам: 2026: 29 · 2025: 61 · 2024: 18

Аннотация

Введение: Всё более широкое применение больших языковых моделей (LLM) генеративного искусственного интеллекта в различных областях медицины и стоматологии, в частности в ортодонтии, вызывает вопросы относительно точности предоставляемых ими сведений.

Цель: Оценить и сравнить ответы четырёх LLM — Google Bard, OpenAI ChatGPT-3.5, ChatGPT-4 и Microsoft Bing — на клинически значимые вопросы в области ортодонтии.

Методы: LLM предложили десять вопросов открытого типа по клинической ортодонтии. Ответы оценивали по шкале от 0 (минимальная оценка) до 10 баллов (максимальная оценка) на основании убедительных научных данных, включая согласительные документы и систематические обзоры, с использованием заранее заданных критериев. Через 4 недели после первоначальной оценки ответы оценили повторно для определения внутриэкспертной воспроизводимости. Для сравнения оценок применяли критерии Фридмана и Вилкоксона, чтобы выявить модель, предоставлявшую наиболее полные, научно точные, понятные и релевантные ответы.

Результаты: Статистически значимых различий между оценками двух экспертов при обоих оцениваниях не выявили, поэтому для каждой LLM рассчитали среднюю оценку. Наивысший средний балл получили ответы Microsoft Bing Chat — 7,1; далее следовали ChatGPT-4 — 4,7, Google Bard — 4,6 и ChatGPT-3.5 — 3,8. Microsoft Bing Chat статистически значимо превзошёл ChatGPT-3.5 (p = 0,017) и Google Bard (p = 0,029), а ChatGPT-4 превзошёл ChatGPT-3.5 (p = 0,011). Однако все модели периодически предоставляли неполные, недостаточно точные с научной точки зрения, неясные или нерелевантные ответы.

Ограничения: Заданные вопросы носили ориентировочный характер и не охватывали всю область ортодонтии.

Выводы: Большие языковые модели обладают значительным потенциалом для поддержки доказательной ортодонтии. Однако их текущие ограничения создают риск принятия ошибочных решений в области медицинской помощи при использовании без должной критической оценки. Поэтому эти инструменты не могут заменить критическое мышление ортодонта и глубокое знание предметной области. Для эффективной интеграции LLM в клиническую практику необходимы дальнейшие исследования, клиническая валидация и совершенствование моделей. Врачам следует учитывать ограничения LLM, поскольку их необдуманное применение может негативно повлиять на лечение пациентов.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.