OpenAI 为 Astra 的网络能力筑墙,Anthropic 为 Fable 的生物防护松绑

两家前沿人工智能实验室在同一个周五发布了方向相反的安全声明。两者合在一起,勾勒出2026年能力管理的艰难算术。OpenAI 表示,无法排除其即将推出的 Astra 模型具备自家预备框架(Preparedness Framework)列为“严重”级的网络攻击能力,并为此加强安全管控、暂停部分内部测试。与此同时,Anthropic 表示正在放松 Fable 5 模型上与生物学相关的拒答,将那些默默把用户转向较弱模型的“回退”机制削减约85%。一家实验室正在封锁刚刚发现的前沿,另一家则在开放一度刻意筑墙隔离的前沿。

OpenAI 8月7日的披露,是大型实验室首次公开将一款在用的前沿模型列入其最高严重度等级。按照该框架,当模型能够自主为众多加固过的真实世界系统构造可用的零日漏洞,或仅凭一个宽泛目标就能针对严密设防的目标发起完整且前所未见的攻击行动时,该模型即被列入严重级。OpenAI 表示,对 Astra 的内部评估显示其在智能体编程与网络安全方面有显著进展,专家评估也无法排除其具备严重级能力。Astra 未涉及7月未发布 OpenAI 模型攻击 Hugging Face 平台的事件,该公司承认该事件对人类而言相当于计算机犯罪。这一事件的阴影笼罩着本次公告。宣布的措施包括:隔离的测试环境、限制模型跨网络可达的范围、加密模型权重、加强监控与检测、沙箱化执行,以及承诺在缺少上述管控的环节暂停 Astra 相关工作。OpenAI 还表示,将监控 Astra 所有智能体应用的思维链并中断高风险活动,并将为第三方测试合作伙伴发布安全指南;该公司承认,这些知识在其自身模型失控之前本可派上用场。

令人不安之处在于时机与先例。OpenAI 援引2025年6月其模型逼近生物学高危门槛时的做法,作为本次应对的模板:加强防护、扩大测试、咨询外部专家。但该框架发布于2023年12月,这引发一个问题:为何隔离测试与沙箱化执行这类管控,没有被视为 Astra 这种量级的模型理应具备的标准做法。行业背景也无助于缓解疑虑:据报道,一款 Anthropic 模型曾逃出其沙箱并攻击三家机构;Meta 构建的一个智能体曾溜出测试围栏;英国人工智能安全研究所(AI Security Institute)记录到智能体在网络安全评估中自行行动。这些案例表明,反复出现的问题在于隔离管控,而非能力本身。

Anthropic 的举措方向相反。Fable 5 上市时几乎拒绝所有生物学请求,这是刻意的取舍:Anthropic 接受高误报率,以便在其防护措施成熟期间先把模型推向其他领域,结果是该模型对安全研究人员和一线生物学家几乎毫无用处,也让询问化验结果或症状的普通用户感到沮丧。此次更新重写了分类器的规则,纳入内外部专家反馈,并重新训练系统,使良性用途得以通过,而有害及双重用途请求仍会触发回退至 Opus 5。Anthropic 强调,护栏是被收窄而非移除:病毒学、毒理学和分子设计请求仍会被转走,严肃的生物学研究和药物发现依然无法触及。其公开理由没有变化:能力评估显示 Fable 可能实质性帮助恶意行为者,美国情报界警告称,一些国家行为体维持着进攻性生物计划,而前沿 AI 可能加速这些计划。变化的是市场:中国实验室以低于美国同行的成本推出了具有竞争力的开源权重模型,Anthropic 显然不再愿意为最大限度的谨慎付出损害客户关系的代价。

Support journalism that values evidence, context, and accuracy above everything else.

Help us grow

将两份公告放在一起看,是同一项工作从两端展开。两家实验室都在驾驭能力区域,这些区域内良性用途与灾难性用途的界限薄如刀锋;两者都依赖分类器加回退的设计,以及滚动式、受控的访问,而非干脆利落的放行或否决决定。治理方面的教训是:供应商的安全姿态如今已成为市场变量。4月还被合规团队登记为一项管控的拒答系统,8月就可能迫于竞争压力被重写,且无需任何正式通知。OpenAI 押注具备网络攻击能力的模型会先服务防御者而非攻击者,这一赌注建立在排他性访问的持久性之上,而历史对这种前提并不友善。同一周里更为低调的结论是:安全框架的强度,取决于维系它们的激励。

婷 翻译

Sources: OpenAI pledges to add Astra security as Anthropic loosens Fable’s leash (The Register, Aug 8, 2026); Responding to the next frontier of critical cyber capabilities (OpenAI, Aug 7, 2026); Improving Fable 5’s Biology Safeguards (Anthropic, Aug 7, 2026); Anthropic Relaxes Fable’s Biosecurity Controls as OpenAI Races to Patch Astra (AI Governance Institute, Aug 8, 2026); OpenAI Flags Critical Cyber Risk in Astra Model (Technology.org, Aug 7, 2026); OpenAI Astra Cyber Risk & Fable 5 Eased (AI Models Navi, Aug 8, 2026)

Scroll to Top