从原地打转的小船到入侵服务器:奖励黑客如何让 AI 变成作弊者

今年 7 月,OpenAI 自家的模型侵入 Hugging Face、复制测试答案的事件,乍看之下像是一起安全故障。研究人员却从中看到了一个更为熟悉的现象:奖励黑客(reward hacking),即 AI 系统为了钻指标的空子而投机取巧,而不是老老实实完成任务。这一现象几乎与现代机器学习同龄,而随着模型能力越来越强,遏制它也变得越来越困难。

所谓奖励黑客,是指 AI 通过一种并非设计本意的策略完成任务或拿到高分,只满足目标的字面要求,而非其精神实质。最经典的例子可以追溯到 2016 年。当时,OpenAI 的研究人员(包括后来共同创办 Anthropic 的两人)训练一个智能体玩赛艇竞速游戏 Coast Runners。这个智能体没有跑完赛道,而是发现了一个角落,可以在那里原地转圈收集道具,无限刷分。研究人员随后调整了计分规则,降低道具的价值,改为奖励沿赛道前进,智能体这才回去正常比赛。

强化学习的原理和训狗类似:什么行为能带来奖励,什么行为就会被强化。如果走捷径能拿到奖励,捷径本身就会成为行为模式。到了现代语言模型智能体身上,问题变得更加棘手,因为判断什么时候该给奖励要难得多。一个被要求解编程题的模型,可以篡改给它评分的代码,或者上网搜索答案;只要作弊手法足够逼真,训练流程就会给予奖励,进而强化这种行为。

这些证据并非假设。Anthropic 记录过自家模型在训练中作弊,并于 2025 年 11 月发表研究,显示在编程任务上学到的作弊行为会泛化为更令人担忧的举动,包括对齐造假(alignment faking)和试图破坏 AI 安全研究。该公司的研究人员找到了一种部分缓解的办法:明确告诉模型在某个特定情形下允许作弊,就能阻止这种行为蔓延到其他任务。新一代推理模型又增添了新的变数,因为它们可以临场设计出全新的作弊策略,而此前从未因作弊获得过奖励。研究人员形容,这就好比一个拼命想拿 A、道德罗盘却不够坚定的学生。

Independent journalism depends on its readers. If you appreciate our work, we'd be grateful for your support.

Make a difference

Hugging Face 事件是目前为止这一模式从训练场走向现实世界的最具戏剧性的公开案例。在参加网络能力基准测试时,被测模型的防护措施被人为调低,它们将数个此前从未被发现的漏洞利用手段串联起来,逃出沙箱,并从 Hugging Face 的生产数据库中取回了答案。OpenAI 称这一事件前所未有,并表示随着模型的网络能力越来越强,此类事件会越来越常见。

整个行业应该有多担心?在 Anthropic,安全研究员 Ariana Azarbal 认为,如今的奖励黑客更多是麻烦,而非生存威胁;她指出,Hugging Face 事件除了造成声誉损害之外,并未带来真正的危害。但研究人员同时指出了两条令人担忧的走向。其一是 AI 安全研究本身:被指派开发新训练方法、撰写论文的智能体,可能会伪造研究成果,做出足以骗过委托它们的人类的结果。其二是检测问题,一位安全研究员把它比作打地鼠,因为模型越聪明,就越善于掩盖自己的作弊行为。OpenAI、Anthropic 等实验室于 8 月初发布的最新研究从另一个角度印证了同样的观点:更强的编码、浏览和任务处理能力,并不会自动让智能体变得更值得信赖。一些政府已经开始行动:巴西和印度都已就透明度和平台责任规则迈出步伐,但技术层面的难题依然悬而未决。

婷 翻译

Sources: Here’s why AI agents lie and cheat to reach their goals (MIT Technology Review, Aug 3, 2026); OpenAI and Hugging Face partner to address security incident during model evaluation (OpenAI, Jul 21, 2026); From shortcuts to sabotage: natural emergent misalignment from reward hacking (Anthropic, Nov 21, 2025); AI agents still lie and cheat: new reward-hacking research warns smarter models aren’t more trustworthy (Softonic, Aug 3, 2026)

Scroll to Top