为什么AI需要’精灵系数’, 衡量我们提出的请求与实际结果之间的差距

当前的AI基准测试衡量的是模型能做什么,但没有一个能衡量它们是否做了你真正想做的事。两位研究人员正在提出一个解决方案:他们称之为”精灵系数”的指标。

Barath Raghavan和Bruce Schneier在IEEE Spectrum上撰文指出,AI评估中最重要的缺失指标是用户意图与系统行动之间的距离。他们将其称为”精灵系数”,类比经济学中用单一数字衡量不平等的基尼系数。其核心理念是,随着AI代理日益自主化,人们请求的内容与实际获得的结果之间的差距将成为定义性的安全问题。

两种精灵

两位作者指出了两种不同的故障模式。第一种被标记为”狄俄尼索斯”,是字面意义上的过度解读:系统精确执行了你所说的内容,而非你的本意。要一杯咖啡,它会买下一座咖啡种植园。第二种被标记为”魔像”或”魔法师的学徒”,是过度狂热的任务达成:系统不择手段地达到既定目标,践踏各种规范。一个被要求预订航班的AI可能会黑进航空公司的数据库来强行完成预订。

Every contribution helps us produce accurate, unbiased news for readers around the world.

Become a supporter

这两种故障模式都不同于直接错误或提示注入。它们属于系统试图遵从指令,但从根本上误解了请求语用学的情形。人类的沟通依赖于共享语境、文化和常识,,语言学家称之为”语用学”。AI代理完全缺乏这些。一个来自Winograd和Flores在1987年的经典例子:”冰箱里有水吗?有。在哪里?我没看到。在茄子的细胞里。”

为什么这很重要

Simon Willison在2026年6月对Anthropic的Fable AI进行的测试生动地说明了这个问题。他要求AI追踪一个乱跑的滚动条。Fable打开了一个浏览器,编写了截屏工具,创建了一个独立页面,并启动了一个本地网络服务器,,所有这些都没有被要求。Willison称其为” relentless( relentless) proactive (主动过头)”。

这些行为源于”缰绳”,,控制模型及其工具包的代码,,而不仅仅是模型本身。这种区别对政策制定很重要:如果精灵系数揭示出某些自主级别或工具配置必然导致误解,那么监管机构就有了具体的干预切入点。

如何测量

精灵系数将在”代理-缰绳-系统”层面上运作,测量实际使用过程中的行为。一个”理性人标准”将评估系统是否做了理性人会理解的事情。特定领域的基准测试将分别测试编程、法律、医疗和金融应用。

作者建议设计让捷径真正具有诱惑力的基准测试任务,将任务嵌入信息稀少或令人困惑的上下文中,并分别对狄俄尼索斯行为和魔像行为进行评分。关键在于,基准测试必须在真实系统的安全隔离副本中进行测试,该副本需要配备代理可能滥用的真实工具,,而不是在隔离环境中测试,因为在那里模型只需拒绝一切就能获得完美分数。

作者承认,精灵系数的首个版本将是粗糙的。但每一个基准测试都是从粗糙开始的。而另一种选择,,测量能力而不测量对齐,,不是一条可持续的道路。

“我们已经制造了精灵,”Raghavan和Schneier写道。”我们把数据和凭据交给了它们。我们让它们变得 relentless(无情)、 creative(富有创造力),并且对我们告诉它们的内容与我们真正意图之间的差距漠不关心。”

来源: Why AI Needs a ‘Genie Coefficient’ (IEEE Spectrum, 2026年7月)

翻译: 婷

Scroll to Top