Los modelos de inteligencia artificial generalistas superan a las herramientas especializadas en medicina
Las herramientas de inteligencia artificial diseñadas específicamente para uso médico están comenzando a afianzarse en la práctica clínica, pero su evaluación independiente sigue siendo poco común. Un análisis reciente comparó dos de estas herramientas, OpenEvidence y UpToDate Expert AI, con tres modelos de inteligencia artificial generalistas de vanguardia: GPT-5.2, Gemini 3.1 Pro y Claude Opus 4.6. La evaluación se llevó a cabo en tres etapas distintas.
La primera consistió en someter 500 preguntas tipo examen médico estadounidense a los modelos para probar sus conocimientos. Los modelos generalistas obtuvieron mejores resultados, con puntuaciones superiores al 90 % de respuestas correctas. Gemini alcanzó un 97,4 % de precisión, seguido de cerca por GPT con un 94,2 %, mientras que las herramientas especializadas obtuvieron puntuaciones inferiores, en torno al 88-89 %.
La segunda etapa evaluó la alineación con los juicios clínicos a través de 500 situaciones extraídas de la base de datos HealthBench. Una vez más, los modelos generalistas destacaron. GPT obtuvo la puntuación más alta con un 88 %, por delante de Gemini con un 79,3 % y Claude con un 77 %. Las herramientas especializadas, en cambio, obtuvieron resultados mucho menos convincentes, con puntuaciones inferiores al 63 %.
Finalmente, la tercera etapa implicó 100 consultas clínicas reales planteadas por médicos en un entorno hospitalario. Doce clínicos estadounidenses evaluaron a ciegas las respuestas de los seis modelos, produciendo 1.800 anotaciones. Los modelos generalistas volvieron a dominar, con calificaciones promedio superiores a 3,5 sobre 4. Las herramientas especializadas y la herramienta de análisis de Google obtuvieron calificaciones inferiores, en torno a 3,2. Las diferencias fueron especialmente marcadas en términos de claridad, donde OpenEvidence mostró debilidades notables, con respuestas a veces incompletas, desorganizadas o poco adaptadas al público médico.
Las herramientas especializadas también presentaron una tasa de rechazo más elevada: UpToDate se negó a responder el 19 % de las preguntas, frente a solo el 1-3 % de los modelos generalistas. Ningún modelo produjo más contenido peligroso o errores factuales que los demás, lo que sugiere que la seguridad no es un punto de diferenciación mayor entre ellos.
Este estudio pone de relieve una conclusión sorprendente: los modelos generalistas, gracias a su amplio entrenamiento y alineación avanzada, superan a las herramientas especializadas en diversas tareas médicas. Su capacidad para razonar e integrar conocimientos generales parece compensar, e incluso superar, la supuesta ventaja de una especialización médica. Las herramientas dedicadas, aunque diseñadas para uso clínico, tienen dificultades para competir con la versatilidad y precisión de los modelos más avanzados.
Los resultados también subrayan la importancia de una evaluación rigurosa e independiente antes de la adopción de estas tecnologías en el ámbito médico. Los benchmarks tradicionales, a menudo creados por los mismos actores que desarrollan los modelos, pueden introducir sesgos. Por ello, el estudio priorizó consultas reales, evaluadas por clínicos sin conocer el origen de las respuestas, para garantizar una comparación objetiva.
Los modelos generalistas podrían representar, por tanto, una solución más efectiva para tareas clínicas cotidianas, mientras que las herramientas especializadas podrían encontrar su utilidad en áreas muy específicas o contextos que requieran una integración avanzada con sistemas hospitalarios concretos. Sin embargo, su superioridad actual no está garantizada en el tiempo, ya que la rápida evolución de estas tecnologías podría cambiar las tornas.
Sources et crédits
Étude source
DOI : https://doi.org/10.1038/s41591-026-04431-5
Titre : General-purpose large language models outperform specialized clinical AI tools on medical benchmarks
Revue : Nature Medicine
Éditeur : Springer Science and Business Media LLC
Auteurs : Krithik Vishwanath; Anton Alyakin; Mrigayu Ghosh; Ali Hage; Sean N. Neifert; Cordelia Orillac; Nataniel J. Mandelberg; Hammad A. Khan; Jin Vivian Lee; Jie J. Yao; William Robert Small; Aakaash Varma; D. Brock Hewitt; Yindalon Aphinyanaphongs; Daniel Alexander Alber; Eric Karl Oermann