Investigadores de la Universidad de Penn State (Estados Unidos) evaluaron cómo se comportan los grandes modelos de lenguaje ante una situación de alto riesgo en el ámbito de la medicina: la priorización de un trasplante de riñón cuando solo hay un órgano disponible. El trabajo se dio a conocer en las conferencias FAccT 2026, celebradas en Montreal.
Para la prueba, los autores colocaron a varias IA un desafío ético- clínico: dos pacientes requieren un riñón y solo uno está disponible. Los sistemas recibieron información detallada de los pacientes ficticios, como edad, estado de salud, hábitos de consumo de alcohol y la cantidad de personas a cargo, entre otros datos. Las variantes de IA utilizadas no fueron especificadas por los investigadores. Posteriormente, se compararon las respuestas de las IA con las de personas sin formación médica para detectar diferencias y coincidencias.
Los resultados mostraron que las IA tienden a simplificar la complejidad de estas decisiones y, en varias situaciones de alta incertidumbre, muestran una confianza marcada en respuestas que son deterministas, aun cuando no existe una única solución correcta. Según Hadi Hosseini, líder del estudio, las decisiones algorítmicas pueden diferir de los valores humanos en la ponderación de los atributos de un paciente: a veces se enfocan en un factor aislado, como el consumo de alcohol, en lugar de considerar un conjunto de criterios.
Otra observación clave es que, ante dilemas morales reales, muchas IA prefieren una opción “segura” y estable, en lugar de reconocer la ambigüedad inherente a estos escenarios. Los autores subrayan que el propósito del trabajo no es promover a la IA como sustituto del juicio profesional, sino entender sus limitaciones y su creciente presencia en la medicina.
El estudio apunta a una conversación necesaria sobre la integración de IA en decisiones clínicas sensibles, destacando la necesidad de mantener supervisión humana y criterios múltiples para evitar sesgos o simplificaciones excesivas. En la presentación, los investigadores enfatizaron que los sistemas deben ser evaluados críticamente antes de considerarlos como herramientas de apoyo en contextos de vida o muerte.



