Научная статья

Оценка чувствительности, специфичности и точности ChatGPT-3.5, ChatGPT-4, Bing AI и Bard по сравнению с традиционными клиническими инструментами выявления лекарственных взаимодействий

Evaluating the Sensitivity, Specificity, and Accuracy of ChatGPT-3.5, ChatGPT-4, Bing AI, and Bard Against Conventional Drug-Drug Interactions Clinical Tools

Drug, Healthcare and Patient Safety
10.2147/DHPS.S425858
Полный текст Открыть в журнале PubMed PMC
FWCI: 3.44FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Процитировано: 122 · Ссылки: 30 · Лицензия: CC-BY-NC
Цитирование по годам: 2026: 24 · 2025: 51 · 2024: 40 · 2023: 10

Аннотация

Введение: Платформы искусственного интеллекта используют передовые алгоритмы и потенциально могут найти широкое применение в здравоохранении. Однако данные о точности чат-ботов с искусственным интеллектом по сравнению с традиционными инструментами выявления лекарственных взаимодействий ограничены. Целью исследования была оценка чувствительности, специфичности и точности ChatGPT-3.5, ChatGPT-4, Bing AI и Bard при прогнозировании лекарственных взаимодействий.

Методы: Чат-боты на основе искусственного интеллекта (ChatGPT-3.5, ChatGPT-4, Microsoft Bing AI и Google Bard) сравнили по способности выявлять клинически значимые лекарственные взаимодействия для 255 пар препаратов. Для каждого инструмента рассчитывали описательные статистические показатели, включая специфичность, чувствительность, точность, отрицательную прогностическую ценность и положительную прогностическую ценность.

Результаты: При использовании платного инструмента в качестве эталонного значения специфичность варьировала от 0,372 для ChatGPT-3.5 до 0,769 для Microsoft Bing AI. Наилучшие результаты показал Microsoft Bing AI: точность составила 0,788, тогда как у ChatGPT-3.5 она была наименьшей — 0,469. При замене эталонного инструмента на бесплатный источник данных о лекарственных взаимодействиях показатели всех программ в целом улучшились, однако ChatGPT-3.5 по-прежнему продемонстрировал наименьшие специфичность (0,392) и точность (0,525), а Microsoft Bing AI — наибольшие специфичность (0,892) и точность (0,890). При оценке стабильности точности для двух различных классов препаратов наибольшая вариабельность отмечалась у ChatGPT-3.5 и ChatGPT-4. Кроме того, при анализе двух препаратов, относящихся к одному классу, у ChatGPT-3.5, ChatGPT-4 и Bard наблюдались наиболее выраженные колебания специфичности.

Выводы: Bing AI продемонстрировал наибольшие точность и специфичность, превзойдя Google Bard, ChatGPT-3.5 и ChatGPT-4. Полученные результаты подчёркивают значительный потенциал этих инструментов искусственного интеллекта для преобразования медицинской помощи. Хотя оценённые платформы не лишены ограничений, их способность быстро анализировать потенциально значимые взаимодействия при достаточно высокой чувствительности свидетельствует о перспективности их применения для повышения безопасности пациентов.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.