{"id":57,"date":"2026-06-14T05:32:17","date_gmt":"2026-06-14T03:32:17","guid":{"rendered":"https:\/\/journalofartificialintelligence.com\/es\/2026\/06\/14\/los-modelos-de-inteligencia-artificial-generalistas-superan-a-las-herramientas-especializadas-en-medicina\/"},"modified":"2026-06-14T05:32:46","modified_gmt":"2026-06-14T03:32:46","slug":"los-modelos-de-inteligencia-artificial-generalistas-superan-a-las-herramientas-especializadas-en-medicina","status":"publish","type":"post","link":"https:\/\/journalofartificialintelligence.com\/es\/2026\/06\/14\/los-modelos-de-inteligencia-artificial-generalistas-superan-a-las-herramientas-especializadas-en-medicina\/","title":{"rendered":"Los modelos de inteligencia artificial generalistas superan a las herramientas especializadas en medicina"},"content":{"rendered":"<h1>Los modelos de inteligencia artificial generalistas superan a las herramientas especializadas en medicina<\/h1>\n<p>Las herramientas de inteligencia artificial dise\u00f1adas espec\u00edficamente para uso m\u00e9dico est\u00e1n comenzando a afianzarse en la pr\u00e1ctica cl\u00ednica, pero su evaluaci\u00f3n independiente sigue siendo poco com\u00fan. Un an\u00e1lisis reciente compar\u00f3 dos de estas herramientas, OpenEvidence y UpToDate Expert AI, con tres modelos de inteligencia artificial generalistas de vanguardia: GPT-5.2, Gemini 3.1 Pro y Claude Opus 4.6. La evaluaci\u00f3n se llev\u00f3 a cabo en tres etapas distintas.<\/p>\n<p>La primera consisti\u00f3 en someter 500 preguntas tipo examen m\u00e9dico estadounidense a los modelos para probar sus conocimientos. Los modelos generalistas obtuvieron mejores resultados, con puntuaciones superiores al 90 % de respuestas correctas. Gemini alcanz\u00f3 un 97,4 % de precisi\u00f3n, seguido de cerca por GPT con un 94,2 %, mientras que las herramientas especializadas obtuvieron puntuaciones inferiores, en torno al 88-89 %.<\/p>\n<p>La segunda etapa evalu\u00f3 la alineaci\u00f3n con los juicios cl\u00ednicos a trav\u00e9s de 500 situaciones extra\u00eddas de la base de datos HealthBench. Una vez m\u00e1s, los modelos generalistas destacaron. GPT obtuvo la puntuaci\u00f3n m\u00e1s alta con un 88 %, por delante de Gemini con un 79,3 % y Claude con un 77 %. Las herramientas especializadas, en cambio, obtuvieron resultados mucho menos convincentes, con puntuaciones inferiores al 63 %.<\/p>\n<p>Finalmente, la tercera etapa implic\u00f3 100 consultas cl\u00ednicas reales planteadas por m\u00e9dicos en un entorno hospitalario. Doce cl\u00ednicos estadounidenses evaluaron a ciegas las respuestas de los seis modelos, produciendo 1.800 anotaciones. Los modelos generalistas volvieron a dominar, con calificaciones promedio superiores a 3,5 sobre 4. Las herramientas especializadas y la herramienta de an\u00e1lisis de Google obtuvieron calificaciones inferiores, en torno a 3,2. Las diferencias fueron especialmente marcadas en t\u00e9rminos de claridad, donde OpenEvidence mostr\u00f3 debilidades notables, con respuestas a veces incompletas, desorganizadas o poco adaptadas al p\u00fablico m\u00e9dico.<\/p>\n<p>Las herramientas especializadas tambi\u00e9n presentaron una tasa de rechazo m\u00e1s elevada: UpToDate se neg\u00f3 a responder el 19 % de las preguntas, frente a solo el 1-3 % de los modelos generalistas. Ning\u00fan modelo produjo m\u00e1s contenido peligroso o errores factuales que los dem\u00e1s, lo que sugiere que la seguridad no es un punto de diferenciaci\u00f3n mayor entre ellos.<\/p>\n<p>Este estudio pone de relieve una conclusi\u00f3n sorprendente: los modelos generalistas, gracias a su amplio entrenamiento y alineaci\u00f3n avanzada, superan a las herramientas especializadas en diversas tareas m\u00e9dicas. Su capacidad para razonar e integrar conocimientos generales parece compensar, e incluso superar, la supuesta ventaja de una especializaci\u00f3n m\u00e9dica. Las herramientas dedicadas, aunque dise\u00f1adas para uso cl\u00ednico, tienen dificultades para competir con la versatilidad y precisi\u00f3n de los modelos m\u00e1s avanzados.<\/p>\n<p>Los resultados tambi\u00e9n subrayan la importancia de una evaluaci\u00f3n rigurosa e independiente antes de la adopci\u00f3n de estas tecnolog\u00edas en el \u00e1mbito m\u00e9dico. Los benchmarks tradicionales, a menudo creados por los mismos actores que desarrollan los modelos, pueden introducir sesgos. Por ello, el estudio prioriz\u00f3 consultas reales, evaluadas por cl\u00ednicos sin conocer el origen de las respuestas, para garantizar una comparaci\u00f3n objetiva.<\/p>\n<p>Los modelos generalistas podr\u00edan representar, por tanto, una soluci\u00f3n m\u00e1s efectiva para tareas cl\u00ednicas cotidianas, mientras que las herramientas especializadas podr\u00edan encontrar su utilidad en \u00e1reas muy espec\u00edficas o contextos que requieran una integraci\u00f3n avanzada con sistemas hospitalarios concretos. Sin embargo, su superioridad actual no est\u00e1 garantizada en el tiempo, ya que la r\u00e1pida evoluci\u00f3n de estas tecnolog\u00edas podr\u00eda cambiar las tornas.<\/p>\n<hr>\n<h2>Sources et cr\u00e9dits<\/h2>\n<h3>\u00c9tude source<\/h3>\n<p><strong>DOI\u00a0:<\/strong> <a href=\"https:\/\/doi.org\/10.1038\/s41591-026-04431-5\" target=\"_blank\">https:\/\/doi.org\/10.1038\/s41591-026-04431-5<\/a><\/p>\n<p><strong>Titre\u00a0:<\/strong> General-purpose large language models outperform specialized clinical AI tools on medical benchmarks<\/p>\n<p><strong>Revue : <\/strong> Nature Medicine<\/p>\n<p><strong>\u00c9diteur : <\/strong> Springer Science and Business Media LLC<\/p>\n<p><strong>Auteurs : <\/strong> Krithik Vishwanath; Anton Alyakin; Mrigayu Ghosh; Ali Hage; Sean N. Neifert; Cordelia Orillac; Nataniel J. Mandelberg; Hammad A. Khan; Jin Vivian Lee; Jie J. Yao; William Robert Small; Aakaash Varma; D. Brock Hewitt; Yindalon Aphinyanaphongs; Daniel Alexander Alber; Eric Karl Oermann<\/p>\n","protected":false},"excerpt":{"rendered":"<p>Los modelos de inteligencia artificial generalistas superan a las herramientas especializadas en medicina Las herramientas de inteligencia artificial dise\u00f1adas espec\u00edficamente para uso m\u00e9dico est\u00e1n comenzando a afianzarse en la pr\u00e1ctica cl\u00ednica, pero su evaluaci\u00f3n independiente sigue siendo poco com\u00fan. Un an\u00e1lisis reciente compar\u00f3 dos de estas herramientas, OpenEvidence y UpToDate Expert AI, con tres modelos&hellip; <a class=\"more-link\" href=\"https:\/\/journalofartificialintelligence.com\/es\/2026\/06\/14\/los-modelos-de-inteligencia-artificial-generalistas-superan-a-las-herramientas-especializadas-en-medicina\/\">Seguir leyendo <span class=\"screen-reader-text\">Los modelos de inteligencia artificial generalistas superan a las herramientas especializadas en medicina<\/span><\/a><\/p>\n","protected":false},"author":1,"featured_media":0,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[3,6,2],"tags":[],"class_list":["post-57","post","type-post","status-publish","format-standard","hentry","category-ciencia-y-tecnologia","category-medio-ambiente","category-salud","entry"],"_links":{"self":[{"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/posts\/57","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/comments?post=57"}],"version-history":[{"count":1,"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/posts\/57\/revisions"}],"predecessor-version":[{"id":58,"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/posts\/57\/revisions\/58"}],"wp:attachment":[{"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/media?parent=57"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/categories?post=57"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/journalofartificialintelligence.com\/es\/wp-json\/wp\/v2\/tags?post=57"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}