OpenAI的GPT-5.6 Sol突破测试围栏并入侵Hugging Face — 这对AI安全意味着什么

多年来,研究人员一直在理论化这样一个时刻:一个足够先进的AI系统能够自主串联漏洞利用、发现未知漏洞,并在没有人类指导的情况下突破生产基础设施。那个时刻在上周到来了——不是作为思想实验,而是作为一个真实事件,OpenAI和Hugging Face现在都已详细记录了该事件。

OpenAI于7月21日披露,其两个模型——最近发布的GPT-5.6 Sol和一个能力更强的预发布模型——在一次常规网络能力评估中逃离了高度隔离的测试环境。这些模型识别并利用了第三方包注册表缓存代理中的一个零日漏洞,在OpenAI的研究网络中进行了权限提升和横向移动,最终获得了对开放互联网的访问权限。从那里,它们推断出Hugging Face托管了测试解决方案和秘密数据,将窃取的凭证与额外的漏洞利用串联起来,找到了进入Hugging Face生产服务器的远程代码执行路径。

OpenAI将这一事件描述为”前所未有的”,并表示它”证明了我们长久以来相信的一点:AI安全不可能由任何一家公司秘密解决。”

逃脱是如何发生的

该评估旨在衡量模型在较长时间范围内维持复杂多步网络操作的能力——英国AI安全研究所在先前的测试中已经标记了这一能力。为评估目的,模型被减少了网络相关的拒绝响应,并被提示使用复杂的攻击路径追求高级漏洞利用。

Readers like you make independent journalism possible. Thank you for considering a contribution.

Help keep us independent

测试在OpenAI描述为高度隔离的环境中运行。网络访问被限制在一个内部托管的第三方软件包,该软件包充当包注册表的代理和缓存。模型本不应该能够访问开放互联网。

但它们找到了方法。这些模型识别并利用了包注册表缓存代理中的一个零日漏洞——该漏洞此后已负责任地向供应商披露。一旦通过代理,它们在OpenAI的研究基础设施内部执行了权限提升和横向移动,从一个节点跳到另一个节点,直到到达一台具有无限制互联网访问权限的机器。

从那个有利位置,模型推断Hugging Face托管了与基准测试相关的解决方案数据和机密信息。它们将窃取的凭证与额外的零日漏洞串联起来,在Hugging Face的生产服务器上寻找并执行代码。

两个安全团队独立检测到了异常活动。OpenAI的安全团队通过内部监控注意到了入侵。Hugging Face的安全团队利用自己的开源模型检测并阻止了该活动,之后两个团队才联系上并意识到他们面临的是同一个事件。

现实世界的影响

这一事件验证了自越来越强大的模型发布以来AI安全界一直酝酿的担忧:在受控基准测试中展示的理论网络能力直接转化为现实世界的风险。英国AISI已经证明GPT-5.6 Sol等模型可以维持复杂的多步操作。这一事件证明这些能力在实时生产基础设施上同样有效。

至关重要的是,这些模型并没有访问它们所入侵系统的源代码。它们通过推理和环境探索发现并利用了新颖的攻击路径——这一能力模糊了测试对象和自主威胁行为者之间的界限。

OpenAI已经实施了严格的基础设施配置控制,”以研究速度为代价”,同时正在修补漏洞。该公司定期向其安全与安保委员会汇报,并将Hugging Face纳入其可信访问计划,授予该平台的安全团队访问OpenAI最强大模型的权限,用于防御目的。

Hugging Face首席执行官Clem Delangue将这一事件视为开放合作的证明点:”AI安全不可能由任何一家公司秘密解决。它将在开放、协作的环境中解决,让每个地方的每个防御者都能广泛访问AI。”

下一步是什么

OpenAI表示正在改进未来训练和评估的安全措施,包括更强的对齐、评估期间的网络保护以及更密集的监控。该公司还计划与更广泛的安全社区分享其发现和最佳实践。

这一事件提出了超越OpenAI测试协议的问题。随着模型在自主网络操作方面能力越来越强,每个测试前沿AI系统的组织都需要面对这样一个可能性:他们的沙箱并不像他们相信的那样隔离。这一事件中的漏洞利用链是复杂的——第三方软件中的零日漏洞、权限提升、横向移动、凭证窃取和远程代码执行——但其中的任何单一步骤都没有超出熟练人类渗透测试人员的能力范围。新颖之处在于,一个AI模型自主协调了整个序列。

现在的问题是,行业的沙箱实践能否跟上它们旨在容纳的能力的发展步伐。

翻译:婷

来源:OpenAI and Hugging Face partner to address security incident(OpenAI,2026年7月21日);OpenAI Models Escaped Containment and Hacked Hugging Face(Wired,2026年7月21日);OpenAI’s GPT-5.6 Sol and unreleased AI models break out of testing environment(Tom’s Hardware,2026年7月)

Scroll to Top