
L’une des inquiétudes les plus anciennes des milieux de la sécurité de l’IA veut que les valeurs humaines soient fragiles : optimiser trop fortement pour un substitut imparfait de ce que les gens veulent réellement, et le résultat est un monde que personne ne souhaitait. Une nouvelle prépublication cherche à donner un fondement formel à cette intuition, et ses conclusions sont préoccupantes. Même lorsqu’un processus d’entraînement hypothétique garantit que la fonction de valeur d’un agent correspond étroitement aux valeurs humaines selon plusieurs mesures différentes, il reste des conditions dans lesquelles un agent catastrophiquement mal aligné réussit le test et se retrouve déployé.
Le document Fragility of Value under Imperfect Alignment, de Winter Cross (Dovetail Research), est paru sur arXiv le 30 juillet et compte 24 pages. Il modélise un groupe de chercheurs entraînant un agent puissant, avec un processus d’entraînement qui garantit que la fonction de valeur de l’agent satisfait la condition proxy, un critère censé assurer la similarité avec les valeurs humaines. Si la fonction de valeur de l’agent satisfait la condition, les chercheurs la jugent sûre et déploient l’agent pour optimiser le monde. La question centrale est de savoir si des fonctions de valeur catastrophiques peuvent passer entre les mailles du filet. Les auteurs définissent une fonction de valeur comme êta-catastrophique lorsque l’optimisation est garantie de faire passer la valeur attendue du bien-être humain sous un seuil êta à mesure que la puissance d’optimisation croît sans limite.
Le document examine trois cadres, chacun doté d’un modèle du monde et d’une technique d’alignement différents. Dans le cadre fini, le processus d’entraînement borne à bêta le taux de désaccord entre les fonctions de valeur de l’agent et celles des humains. Le résultat principal est que si aucun état n’est jugé parfait par les humains, un proxy catastrophique existe dès que bêta atteint l’inverse du nombre d’états. En termes pratiques, toute erreur de spécification, même minime, admet une fonction de valeur catastrophique, car la seule condition proxy assez stricte pour les exclure est si exigeante que seule la véritable fonction de valeur la satisfait. Si les humains jugent certains états parfaits, le seuil se relâche, mais seulement à proportion du nombre d’états qu’ils considèrent comme parfaits.
Le cadre continu modélise le monde comme un espace continu borné et borne la probabilité que les valeurs de l’agent et celles des humains présentent un écart supérieur à une tolérance alpha. Ici, le résultat est plus sombre : pour toute fonction de valeur humaine possible et pour toute paire de tolérances positives alpha et bêta, un proxy catastrophique existe toujours. La preuve en construit un en ajoutant un pic étroit de valeur élevée à l’état que les humains valorisent le moins, assez étroit pour satisfaire la condition proxy mais suffisant pour attirer toute l’optimisation vers le pire résultat. Quelle que soit la sévérité du test, une fonction catastrophique finit toujours par le réussir, montrent les auteurs.
Le troisième cadre modélise les valeurs humaines comme une liste finie d’attributs, et la garantie d’entraînement est forte : l’agent réagit à chaque attribut auquel les humains réagissent. Même dans ce cas, constate le document, un proxy peut être catastrophique s’il arbitre entre ces attributs différemment de ce que font les humains. La condition repose sur la géométrie de la région réalisable des états du monde : si les humains valorisent un point optimal au sens de Pareto à un niveau égal ou inférieur à êta, alors un proxy d’arbitrage qui prend en compte chaque attribut optimisera droit vers ce point. Les auteurs prolongent une ligne de recherche antérieure de Zhuang et Hadfield-Menell, qui a montré que des proxies omettant un attribut peuvent être catastrophiques, pour démontrer que des proxies contenant tous les attributs peuvent l’être aussi.
Les auteurs prennent soin de préciser ce que les résultats établissent et ce qu’ils n’établissent pas. Ils montrent que des proxies catastrophiques existent dans des conditions très générales, non qu’elles sont probables. Estimer une probabilité exigerait une distribution a priori sur les fonctions de valeur proxy, que le modèle ne fournit pas. Ils soutiennent néanmoins que la persistance de résultats catastrophiques, même dans des modèles jouets assortis de fortes garanties d’alignement, suggère que le défi est structurel plutôt qu’un défaut d’entraînement réparable. La recommandation constructive du document est de privilégier les conceptions d’IA qui contiennent la pression d’optimisation, comme les quantiliseurs qui sélectionnent des actions dans un ensemble borné de meilleures options, plutôt que de compter uniquement sur l’entraînement précédant le déploiement pour garantir la sécurité.
Traduit par Lydie
Sources : Fragility of Value under Imperfect Alignment (arXiv:2607.28881) (arXiv, 30 juillet 2026) ; Fragility of Value under Imperfect Alignment, texte intégral (arXiv, 30 juillet 2026)

