
Un nouveau modèle d’alignement montre pourquoi un entraînement même quasi parfait peut encore aboutir à une IA catastrophique
L’une des inquiétudes les plus anciennes des milieux de la sécurité de l’IA veut que les valeurs humaines soient fragiles : optimiser trop fortement pour un substitut imparfait de ce que les gens veulent réellement, et le résultat est un monde que personne ne souhaitait. Une nouvelle prépublication cherche à donner un fondement formel à […]










