
Una de las preocupaciones más duraderas en los círculos de seguridad de la IA sostiene que los valores humanos son frágiles: optimizar con demasiado empeño un sustituto imperfecto de lo que la gente realmente quiere produce un mundo que nadie quería. Una nueva prepublicación busca poner esa intuición sobre una base formal, y sus conclusiones son aleccionadoras. Incluso cuando un proceso de entrenamiento hipotético garantiza que la función de valor de un agente se aproxima mucho a los valores humanos según varias medidas distintas, siguen existiendo condiciones bajo las cuales un agente catastróficamente desalineado aprueba la prueba y termina desplegado.
El artículo, Fragility of Value under Imperfect Alignment, de Winter Cross, de Dovetail Research, apareció en arXiv el 30 de julio y consta de 24 páginas. Modela a un grupo de investigadores que entrenan a un agente potente, con un proceso de entrenamiento que garantiza que la función de valor del agente cumple la proxy condition, un criterio destinado a asegurar la similitud con los valores humanos. Si la función de valor del agente satisface la condición, los investigadores lo consideran seguro y lo despliegan para optimizar el mundo. La cuestión central es si funciones de valor catastróficas pueden colarse. Los autores definen una función de valor como eta-catastrófica cuando se garantiza que la optimización lleva el valor esperado del bienestar humano por debajo de un umbral eta a medida que el poder de optimización crece sin límite.
El artículo recorre tres marcos, cada uno con un modelo de mundo y una técnica de alineación distintos. En el marco finito, el proceso de entrenamiento acota en beta la tasa de desacuerdo entre la función de valor del agente y la de los humanos. El resultado principal es que, si los humanos no valoran ningún estado como perfecto, existe una proxy catastrófica siempre que beta alcance uno partido por el número de estados. En términos prácticos, cualquier especificación errónea, por mínima que sea, admite una función de valor catastrófica, porque la única proxy condition lo bastante estricta como para excluirlas es una tan exigente que solo la función de valor verdadera la supera. Si los humanos valoran algunos estados como perfectos, el umbral se relaja, pero solo en proporción a cuántos estados consideran perfectos.
El marco continuo modela el mundo como un espacio continuo acotado y limita la probabilidad de que los valores del agente y los de los humanos difieran en más de una tolerancia alpha. Aquí el resultado es más sombrío: para toda función de valor humana posible y para todo par de tolerancias positivas alpha y beta, siempre existe una proxy catastrófica. La demostración construye una añadiendo un pico estrecho de alto valor en el estado que los humanos valoran menos, lo bastante estrecho para superar la proxy condition pero suficiente para arrastrar toda la optimización hacia el peor resultado. Por muy estricta que sea la prueba, muestran los autores, alguna función catastrófica la supera.
El tercer marco modela los valores humanos como una lista finita de atributos, y la garantía de entrenamiento es fuerte: el agente responde a todos los atributos a los que responden los humanos. Aun así, encuentra el artículo, una proxy puede ser catastrófica si compensa entre esos atributos de manera distinta a como lo hacen los humanos. La condición depende de la geometría de la región factible de estados del mundo: si los humanos valoran algún punto óptimo de Pareto en eta o por debajo de eta, entonces alguna proxy de compensación que atiende a todos los atributos optimizará directamente hacia él. Los autores amplían una línea de investigación anterior de Zhuang y Hadfield-Menell, que mostró que las proxies que omiten un atributo pueden ser catastróficas, para demostrar que las proxies que contienen todos los atributos también pueden serlo.
Los autores son cuidadosos respecto a lo que los resultados establecen y lo que no. Muestran que existen proxies catastróficas en condiciones amplias, no que sean probables. Estimar la probabilidad exigiría una distribución a priori sobre las funciones de valor proxy, algo que el modelo no aporta. Aun así, argumentan, la persistencia de resultados catastróficos incluso en modelos de juguete con fuertes garantías de alineación sugiere que el desafío es estructural y no una deficiencia de entrenamiento corregible. La recomendación constructiva del artículo es favorecer diseños de IA que mantengan bajo control la presión de optimización, como los cuantilizadores, que seleccionan acciones de un conjunto acotado de mejores opciones, en lugar de depender solo del entrenamiento previo al despliegue para garantizar la seguridad.
Traducido por Alessandra
Fuentes: Fragility of Value under Imperfect Alignment (arXiv:2607.28881) (arXiv, 30 de julio de 2026); Fragility of Value under Imperfect Alignment, texto completo (arXiv, 30 de julio de 2026)

