Универсальные модели искусственного интеллекта превосходят специализированные инструменты в медицине
Инструменты искусственного интеллекта, специально разработанные для медицинского применения, начинают занимать своё место в клинической практике, однако их независимая оценка остаётся редкостью. Недавний анализ сравнил два таких инструмента, OpenEvidence и UpToDate Expert AI, с тремя передовыми универсальными моделями искусственного интеллекта: GPT-5.2, Gemini 3.1 Pro и Claude Opus 4.6. Оценка проходила в три отдельных этапа.
На первом этапе моделям были предложены 500 вопросов в формате американского медицинского экзамена, чтобы проверить их знания. Универсальные модели показали лучшие результаты, набрать более 90 % правильных ответов. Gemini достиг точности 97,4 %, немного опередив GPT с 94,2 %, тогда как специализированные инструменты получили более низкие оценки — около 88–89 %.
На втором этапе оценивалось соответствие клиническим суждениям на основе 500 ситуаций из базы HealthBench. Здесь универсальные модели снова выделились. GPT показал самый высокий результат — 88 %, опередив Gemini с 79,3 % и Claude с 77 %. Специализированные инструменты продемонстрировали гораздо менее убедительные результаты, их оценки составили менее 63 %.
Наконец, на третьем этапе было задействовано 100 реальных клинических запросов, заданных врачами в больничной среде. Двенадцать американских клиницистов вслепую оценили ответы шести моделей, создав 1800 аннотаций. Универсальные модели снова лидировали, получив средние оценки выше 3,5 из 4. Специализированные инструменты и инструмент анализа от Google получили более низкие оценки — около 3,2. Разница была особенно заметна в плане ясности: OpenEvidence показал значительные слабости, давая иногда неполные, неорганизованные или плохо адаптированные для медицинской аудитории ответы.
Специализированные инструменты также продемонстрировали более высокий уровень отказов: UpToDate отказался отвечать на 19 % вопросов, тогда как универсальные модели — только на 1–3 %. Ни одна из моделей не производила больше опасного контента или фактических ошибок, чем другие, что позволяет предположить, что безопасность не является ключевым фактором различия между ними.
Это исследование выявляет удивительный факт: универсальные модели, благодаря своему обширному обучению и углублённой настройке, превосходят специализированные инструменты в различных медицинских задачах. Их способность рассуждать и интегрировать общие знания, по-видимому, компенсирует, а иногда и превышает предполагаемые преимущества медицинской специализации. Специализированные инструменты, хотя и разработанные для клинического применения, с трудом могут конкурировать с универсальностью и точностью самых передовых моделей.
Результаты также подчёркивают важность строгой и независимой оценки перед внедрением этих технологий в медицинскую среду. Традиционные тесты, часто создаваемые теми же участниками, которые разрабатывают модели, могут содержать предвзятость. Поэтому в исследовании использовались реальные запросы, оцениваемые клиницистами без знания источника ответов, чтобы обеспечить объективное сравнение.
Таким образом, универсальные модели могут стать более эффективным решением для повседневных клинических задач, тогда как специализированные инструменты могут найти применение в узких областях или контекстах, требующих глубокой интеграции с конкретными больничными системами. Однако их текущее превосходство не гарантировано в будущем, так как быстрое развитие этих технологий может изменить расстановку сил.
Sources et crédits
Étude source
DOI : https://doi.org/10.1038/s41591-026-04431-5
Titre : General-purpose large language models outperform specialized clinical AI tools on medical benchmarks
Revue : Nature Medicine
Éditeur : Springer Science and Business Media LLC
Auteurs : Krithik Vishwanath; Anton Alyakin; Mrigayu Ghosh; Ali Hage; Sean N. Neifert; Cordelia Orillac; Nataniel J. Mandelberg; Hammad A. Khan; Jin Vivian Lee; Jie J. Yao; William Robert Small; Aakaash Varma; D. Brock Hewitt; Yindalon Aphinyanaphongs; Daniel Alexander Alber; Eric Karl Oermann