Сравнение результатов большой языковой модели и людей при ответах на вопросы по генетике человека
Analysis of large-language model versus human performance for genetics questions
Аннотация
Большие языковые модели, такие как ChatGPT, в последнее время привлекли значительное внимание. Одно из направлений интереса связано с возможностью применения таких моделей в биомедицине, в том числе в области генетики человека. Для оценки одного из аспектов такого применения мы сравнили результаты ChatGPT и людей при ответах на 85 вопросов по генетике человека с вариантами ответа; всего было получено 13 642 ответа людей. В целом результаты ChatGPT статистически значимо не отличались от результатов людей (p = 0,8327): доля правильных ответов составила 68,2% против 66,6% у людей. И ChatGPT, и люди лучше отвечали на вопросы, требующие запоминания, чем на вопросы, требующие критического мышления (p < 0,0001). При повторном задании одного и того же вопроса ChatGPT часто давал другой ответ — в 16% случаев, включая вопросы, на которые первоначально были даны как правильные, так и неправильные ответы; кроме того, модель приводила правдоподобные объяснения как правильных, так и неправильных ответов. Результаты ChatGPT были впечатляющими, однако в настоящее время модель демонстрирует существенные ограничения для клинического и другого применения в ситуациях с высокими рисками. Устранение этих ограничений будет важно для внедрения модели в реальную практику.
Переведем эту статью за 1 час
Загрузите PDF, а мы сделаем полный перевод, краткий конспект и красивую инфографику.
Попробовать бесплатно →Также в Подтеме: еженедельные литобзоры, база международных клинреков и конспекты свежих мед. статей и подкастов каждый день.