Un equipo de investigadores de la Universidad de Penn State analizó cómo se comportan los modelos de lenguaje ante dilemas de alto riesgo, como la priorización de un trasplante renal. El trabajo se presentó en la conferencia FAccT 2026, en Montreal, y comparó las respuestas de varios LLMs con los juicios de personas sin formación médica para identificar similitudes y diferencias.
En la prueba, se planteó a las IA la tarea de decidir quién debería recibir un riñón cuando hay un único órgano disponible. Para la simulación, se proporcionaron datos de pacientes ficticios (edad, estado de salud, hábitos de consumo de alcohol y cuántas personas dependen de cada uno) para evaluar qué variables ponderan los sistemas y si estas decisiones coinciden con criterios humanos.
Tras analizar las respuestas de las IA y las de evaluadores sin formación médica, los investigadores observaron que los sistemas tienden a simplificar la complejidad de estas decisiones y demostrar una confianza excesiva en respuestas únicas ante dilemas que no tienen una única solución correcta.
“Las IA suelen centrarse en un factor aislado, como el consumo de alcohol, en lugar de balancear múltiples criterios como lo hacen las personas”, mencionó Hadi Hosseini, líder del estudio. También destacó que, incluso cuando se les da la opción de recurrir a la azar, la mayoría escoge una salida determinista, lo que significa una brecha respecto a la realidad de los dilemas morales.
Los autores aclararon que el objetivo no es promover a la IA como sustituto del juicio profesional, sino arrojar luz sobre la creciente presencia de estas tecnologías en la medicina y sus posibles sesgos. En la cobertura del New York Post se puntualiza que los investigadores no buscan incentivar el uso de IA como reemplazo del criterio humano, sino entender sus limitaciones y la forma en que podrían afectar decisiones clínicas si no se gestionan adecuadamente.



