La evaluación de modelos de IA generativa revela escasa divergencia en diagnósticos clínicos
Un reciente estudio ha puesto a prueba la capacidad de dieciséis modelos de lenguaje grandes (LLM) de diez empresas diferentes para ofrecer valoraciones clínicas en el ámbito de la salud mental. Los modelos, que incluyen desarrollos de OpenAI, Anthropic, Google, xAI, Meta, DeepSeek, Mistral, Alibaba, Z.ai y MiniMax Group, fueron instruidos para analizar quince casos clínicos de psicoterapia. La investigación, cuyos resultados y código son abiertos, buscaba determinar si estos sistemas "piensan distinto" cuando se les presenta una situación sin una única respuesta correcta.
La conclusión principal, según se detalla en The Conversation España, es que la divergencia entre las opiniones de los dieciséis modelos fue mínima. El estudio reporta un promedio de 1,69 opiniones distintas, lo que sugiere que las respuestas de múltiples modelos equivalen a menos de dos perspectivas genuinamente diferentes. Este dato es notable si se compara con un solo modelo, que al ser consultado dieciséis veces sobre el mismo caso, ya produce el equivalente a 1,43 opiniones distintas por sí solo. Los autores atribuyen esta similitud a que los modelos se entrenan con datos que se solapan y persiguen objetivos de ajuste muy parecidos, lo que lleva a conclusiones análogas aun cuando las expresen de manera diferente.
Esta convergencia de perspectivas tiene implicaciones directas para el desarrollo y la regulación de sistemas de IA, especialmente en sectores de alto riesgo como la salud. Ejemplos como el orquestador diagnóstico que Microsoft presentó en 2025, concebido como un panel virtual de especialistas con enfoques diversos, o la exigencia del Reglamento de Inteligencia Artificial europeo de supervisión humana en sistemas de alto riesgo, se basan en la premisa de que la discrepancia entre modelos puede actuar como un indicador para la intervención humana. Sin embargo, si los modelos rara vez difieren, la regla de supervisión basada en el desacuerdo se activaría mínimamente, no por acierto del sistema, sino por una uniformidad de criterio que no se ha ganado a través de la reflexión independiente.
La uniformidad en las respuestas de la IA podría afectar la vigilancia y el pensamiento crítico de los profesionales. Estudios previos, como el publicado en The Lancet Gastroenterology and Hepatology en 2025 sobre endoscopistas que utilizaban IA, indicaron una disminución en la tasa de detección de lesiones cuando la herramienta se apagaba, sugiriendo una reducción de la vigilancia. De manera similar, una encuesta de Microsoft y la Universidad Carnegie Mellon a 300 profesionales halló que una mayor confianza en la herramienta se correlacionaba con un menor ejercicio del pensamiento crítico. La investigación actual refuerza la preocupación, argumentando que dieciséis opiniones coincidentes, en lugar de contrastar, solo confirman, lo que puede atrofiar la capacidad de un supervisor para ejercer el criterio independiente que la regulación europea busca preservar. Los resultados, no obstante, se limitan al dominio de la salud mental y al idioma español, lo que insta a la prudencia en su generalización.
Fuente original: The Conversation Espaa







