Научная статья

Большие языковые модели диагностируют детскую пневмонию по рентгенограммам органов грудной клетки на уровне случайного угадывания

Large Language Models Perform at Chance Level in the Diagnosis of Pediatric Pneumonia Using Chest Radiographs

Cureus
10.7759/cureus.92596
Полный текст Открыть в журнале PubMed PMC
FWCI: 0.00FWCI — Field-Weighted Citation Impact (индекс цитируемости с поправкой на область науки). 1.0 = среднее, > 1 = выше среднего · Ссылки: 24 · Лицензия: Неизвестна

Аннотация

Введение: Пневмония остаётся значимой причиной заболеваемости и смертности детей во всём мире. Рентгенография органов грудной клетки широко применяется для диагностики детской пневмонии, однако различить бактериальную и вирусную этиологию по данным визуализации сложно. Большие языковые модели, особенно оснащённые функциями анализа изображений, в предварительных исследованиях продемонстрировали потенциальную пригодность для интерпретации рентгенограмм органов грудной клетки. Тем не менее диагностические возможности универсальных больших языковых моделей без специализированного медицинского обучения или дополнительных модулей остаются недостаточно изученными. В настоящем исследовании оценивали, способны ли такие модели самостоятельно и надёжно различать рентгенограммы органов грудной клетки у детей при бактериальной пневмонии, вирусной пневмонии и отсутствии патологии.

Методы: Оценили четыре общедоступные большие языковые модели: ChatGPT o3, Claude 3.7 Sonnet, Gemini 2.5 Pro и Grok 3. Использовали набор из 44 детских рентгенограмм органов грудной клетки, по заключению специалистов соответствовавших бактериальной пневмонии (n = 17), вирусной пневмонии (n = 13) или отсутствию патологических изменений (n = 14). Каждое изображение дважды анализировала каждая модель по стандартизированному запросу, поэтому на каждое изображение приходилось в общей сложности восемь интерпретаций. Диагностическую точность оценивали относительно консенсусного заключения экспертов. Внутреннюю согласованность определяли путём сравнения повторных интерпретаций. Заранее заданное адаптивное правило остановки основывалось на критериях отсутствия перспективы достижения цели. Расчёт размера выборки и статистический анализ выполняли с помощью G*Power.

Результаты: Для всех моделей и типов рентгенограмм средняя диагностическая точность составила 31%, что соответствовало уровню случайного выбора в задаче классификации с тремя вариантами ответа. Наибольшая точность отмечена при вирусной пневмонии (54%), наименьшая — при нормальных рентгенограммах (18%). Внутренняя согласованность моделей составляла от 46 до 71%, что указывало на ненадёжность результатов. Совпадение с интерпретацией экспертов не превышало 49% ни для одной модели. После анализа 44 случаев были достигнуты критерии отсутствия перспективы достижения цели, в связи с чем сбор данных прекратили досрочно.

Выводы: Доступные широкой публике универсальные большие языковые модели в настоящее время не являются надёжными инструментами диагностики детской пневмонии по рентгенограммам органов грудной клетки. Их точность низка, особенно при исключении заболевания, а ответы недостаточно согласованы между собой. Эти результаты подчёркивают риски применения таких моделей без контроля врача в клинической практике или ориентированных на потребителей сервисах. В дальнейших исследованиях следует сосредоточиться на специализированных радиологических инструментах искусственного интеллекта, обученных на разнообразных, клинически репрезентативных наборах данных и интегрированных в рабочие процессы с участием врача для обеспечения безопасного и эффективного применения.

Переведем эту статью за 1 час

Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.

Попробовать бесплатно →

Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.