Потенциал больших языковых моделей генеративного искусственного интеллекта для доказательной ортодонтии: сравнительное исследование ChatGPT, Google Bard и Microsoft Bing
Evidence-based potential of generative artificial intelligence large language models in orthodontics: a comparative study of ChatGPT, Google Bard, and Microsoft Bing
Аннотация
Введение: Всё более широкое применение больших языковых моделей (LLM) генеративного искусственного интеллекта в различных областях медицины и стоматологии, в частности в ортодонтии, вызывает вопросы относительно точности предоставляемых ими сведений.
Цель: Оценить и сравнить ответы четырёх LLM — Google Bard, OpenAI ChatGPT-3.5, ChatGPT-4 и Microsoft Bing — на клинически значимые вопросы в области ортодонтии.
Методы: LLM предложили десять вопросов открытого типа по клинической ортодонтии. Ответы оценивали по шкале от 0 (минимальная оценка) до 10 баллов (максимальная оценка) на основании убедительных научных данных, включая согласительные документы и систематические обзоры, с использованием заранее заданных критериев. Через 4 недели после первоначальной оценки ответы оценили повторно для определения внутриэкспертной воспроизводимости. Для сравнения оценок применяли критерии Фридмана и Вилкоксона, чтобы выявить модель, предоставлявшую наиболее полные, научно точные, понятные и релевантные ответы.
Результаты: Статистически значимых различий между оценками двух экспертов при обоих оцениваниях не выявили, поэтому для каждой LLM рассчитали среднюю оценку. Наивысший средний балл получили ответы Microsoft Bing Chat — 7,1; далее следовали ChatGPT-4 — 4,7, Google Bard — 4,6 и ChatGPT-3.5 — 3,8. Microsoft Bing Chat статистически значимо превзошёл ChatGPT-3.5 (p = 0,017) и Google Bard (p = 0,029), а ChatGPT-4 превзошёл ChatGPT-3.5 (p = 0,011). Однако все модели периодически предоставляли неполные, недостаточно точные с научной точки зрения, неясные или нерелевантные ответы.
Ограничения: Заданные вопросы носили ориентировочный характер и не охватывали всю область ортодонтии.
Выводы: Большие языковые модели обладают значительным потенциалом для поддержки доказательной ортодонтии. Однако их текущие ограничения создают риск принятия ошибочных решений в области медицинской помощи при использовании без должной критической оценки. Поэтому эти инструменты не могут заменить критическое мышление ортодонта и глубокое знание предметной области. Для эффективной интеграции LLM в клиническую практику необходимы дальнейшие исследования, клиническая валидация и совершенствование моделей. Врачам следует учитывать ограничения LLM, поскольку их необдуманное применение может негативно повлиять на лечение пациентов.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.