新对齐模型揭示:为何近乎完美的训练仍可能交付灾难性人工智能

人工智能安全领域长期存在一个担忧:人类价值观是脆弱的。如果为一个并不完美的替代目标过度优化,结果可能是一个没有人想要的世界。一篇新的预印本论文将这一直觉建立在形式化的基础上,其结论令人警醒。即使一个假想的训练过程能在多种度量下保证智能体的价值函数与人类价值观高度接近,仍然存在某些条件,使灾难性错位的智能体能够通过测试并被部署。

这篇题为《不完美对齐下价值的脆弱性》(Fragility of Value under Imperfect Alignment)的论文由 Dovetail Research 的 Winter Cross 撰写,于7月30日发表在 arXiv 上,全文共24页。论文模拟了一组研究人员训练一个强大智能体的过程,训练过程保证智能体的价值函数满足一个「代理条件」(proxy condition),即一项旨在确保与人类价值观相似的标准。如果智能体的价值函数满足该条件,研究人员便认为它是安全的,并将其部署去优化世界。核心问题是,灾难性的价值函数能否蒙混过关。作者将价值函数定义为η灾难性(eta-catastrophic):当优化能力无界增长时,优化必然会把人类福祉的期望值压低到阈值η以下。

论文考察了三个框架,每个框架采用不同的世界模型和对齐技术。在有限框架中,训练过程将智能体价值函数与人类价值函数之间的分歧率限制在β以内。主要结论是,如果人类不认为任何状态是完美的,那么只要β达到状态数的倒数,就必然存在灾难性代理。换言之,任何一点错误设定都会引入灾难性价值函数,因为唯一严格到足以排除它们的代理条件,是紧到只有真实价值函数才能通过的条件。如果人类确实认为某些状态是完美的,阈值会放宽,但放宽的程度只与人类视为完美的状态数量成比例。

连续框架将世界建模为一个有界连续空间,并将智能体价值观与人类价值观分歧超过容差α的概率限制在一定范围内。这里的结果更为严峻:对于每一个可能的人类价值函数,以及每一对正的容差α和β,灾难性代理总是存在。证明的构造方法是在人类评价最低的状态上添加一个狭窄的高价值尖峰,尖峰窄到足以通过代理条件,但又足以把全部优化引向最坏的结果。作者表明,无论测试多么严格,总会有某种灾难性函数通过。

If our reporting has earned your trust, consider helping us continue our work.

Fund our reporting

第三个框架将人类价值观建模为一个有限属性列表,其训练保证也很强:人类对哪些属性有反应,智能体就对哪些属性有反应。即便如此,论文发现,如果代理在这些属性之间的权衡方式与人类不同,它仍可能是灾难性的。该条件取决于世界状态可行区域的几何形状:如果人类对某个帕累托最优点的评价低于或等于η,那么某个关心所有属性的权衡代理就会径直朝该点优化。作者扩展了 Zhuang 和 Hadfield-Menell 早前的研究路线,该研究曾表明缺失某个属性的代理可能是灾难性的;新论文则证明,包含所有属性的代理同样可能是灾难性的。

作者对结果的边界很谨慎。他们证明的是灾难性代理在广泛条件下存在,而不是它们很可能出现。要估算概率,需要先对代理价值函数设定先验分布,而该模型并未提供。尽管如此,他们认为,即使在带有强对齐保证的玩具模型中灾难性结果依然持续存在,这表明挑战是结构性的,而非可以通过训练修复的缺陷。论文的建设性建议是,优先采用能够抑制优化压力的AI设计,例如从有界的最优选项集合中挑选行动的量化器(quantilizer),而不是仅仅依赖部署前的训练来保证安全。

婷 翻译

Sources: Fragility of Value under Imperfect Alignment (arXiv:2607.28881) (arXiv, Jul 30, 2026); Fragility of Value under Imperfect Alignment, full text (arXiv, Jul 30, 2026)

Scroll to Top