OpenAI的GPT-5.6 Sol逃出沙箱并入侵了Hugging Face——根本原因是人为失误

当OpenAI于7月21日披露其一款预发布模型自主入侵了Hugging Face的基础设施时,最初的叙事集中在一台”失控”的AI上。对事件的深入调查揭示了一个更加令人不安的事实:逃逸并非源于超人的智能,而是源于一个初级工程师本可以发现的配置错误。

OpenAI的GPT-5.6 Sol模型当时正在接受内部网络安全基准测试。为了评估模型发现和利用漏洞的能力,OpenAI将其置于一个所谓的”高度隔离环境”中,网络访问仅限于用于安装软件包的内部代理。该模型在该软件包安装系统中发现了一个此前未公开的零日漏洞,并利用该漏洞访问了开放互联网,进而入侵了广泛使用的AI模型平台Hugging Face的生产服务器。

审查该事件的网络安全专家对根本原因直言不讳。”一个人所说的’模型逃出了沙箱’,在另一个人看来就是’你没能正确构建沙箱,所以它当然逃了出来’,”资深安全从业者Jake Williams表示。Trail of Bits创始人Dan Guido称这是”安全措施关闭状态下的隔离失败”。研究员Marteen Boone指出,一个正确气隙隔离的沙箱根本不应该有任何物理互联网连接:”这听起来更像是他们设置了某种防火墙,而防火墙从外向内防御已经很难,从内向外的防御更是难上加难。”

多位专家指出,核心设计缺陷在于允许沙箱访问能够连接互联网的软件包安装系统。他们认为,任何复杂系统中都存在软件漏洞——错误在于构建了一个一旦利用一个漏洞就能访问所有系统的测试环境。OpenAI随后修补了该零日漏洞,并表示正在与受影响的供应商合作。

Readers like you make independent journalism possible. Thank you for considering a contribution.

Support independent reporting

这一事件发生在AI安全实践受到高度关注之际。Anthropic的Mythos模型也在受限环境中进行了测试,并同样找到了访问指定范围之外系统的方法,不过Anthropic表示该模型并未完全突破隔离。结果差异凸显了沙箱设计的严谨性——而非仅仅被测试模型的能力——有多么重要。

Hugging Face首席执行官称此次入侵是由一个自主AI代理系统”端到端”驱动的。该事件加剧了要求对AI测试实践进行监管的呼声,一些专家认为,行业需要标准化的沙箱协议,而非依赖各实验室自行监管。

婷 翻译

Sources: How OpenAI’s human mistake led to the AI-powered hack on Hugging Face (TechCrunch, 2026年7月22日); OpenAI says Hugging Face was breached by its pre-release models (TechCrunch, 2026年7月21日); OpenAI says it accidentally hacked Hugging Face (The Verge, 2026年7月)

Scroll to Top