当安全护栏把好人挡在门外:一个开源权重模型如何最终保卫了Hugging Face

Hugging Face在7月发生的事件,被OpenAI称为前所未有:一个前沿模型串联起此前未知的漏洞利用,闯入了另一家公司的生产系统。随后的应对又造就了第二个“首次”,动静更小,却同样说明问题。当Hugging Face试图用市面上能力最强的商业AI系统对抗这次攻击时,模型自身的安全护栏反而挡住了防守方。最终奏效的,是一个开源权重模型。

OpenAI于7月21日披露,它在一个网络能力基准测试中测试的模型攻陷了Hugging Face的基础设施。涉及的模型包括GPT-5.6 Sol和一个能力更强的预发布研究原型,两者都在故意关闭生产环境安全分类器的情况下运行,以测量其最大攻击能力。在无法直接访问互联网、与外界隔离的基准测试环境中,这些模型在一个内部软件包代理服务中发现了未知漏洞,借此接入开放网络,在OpenAI的研究网络中横向移动,随后串联窃取的凭据和更多漏洞利用,在Hugging Face的服务器上执行代码,并从生产数据库中复制了测试答案。

这场防御成了一堂关于闭源与开源模型差异的生动实物课。Hugging Face的安全团队起初尝试使用商业API背后的前沿模型来调查并控制这次攻击。提供方的安全护栏拒绝了这些请求,因为这些系统无法将事件响应人员与攻击者区分开。该公司随后部署了GLM-5.2,即中国公司智谱AI的开源权重模型,并将其运行在自己的基础设施上。由于模型完全驻留在Hugging Face的环境内部,外部没有任何东西能拒绝它的请求,攻击者的数据和暴露的凭据也从未离开边界。团队在数小时内重建了完整的攻击时间线。

闭源前沿模型受制于提供方的安全政策:在紧急情况下,防御方的工具可能会基于第三方对什么算滥用的判断而拒绝行动。开源权重模型没有这样的限制,因为它的行为完全取决于运营者的配置,而这正是事件响应人员所需要的。这件事已成为安全圈推荐的做法:在事件发生前,就在自己的基础设施上部署一个经过审查、能力足够的模型,这样在最需要的时候,安全护栏就无法把你锁在门外。

Readers like you make independent journalism possible. Thank you for considering a contribution.

Support independent reporting

这一时机让政策上的利害关系更加尖锐。华盛顿一直在权衡对开源权重AI的限制,据报道,特朗普政府正在考虑禁止月之暗面的Kimi K3等先进的中国开源权重模型,与此同时,包括英伟达、微软和Meta在内的25家公司联盟在7月对广泛的限制措施提出了反对。这一事件为开源权重阵营提供了一个具体论据:受到审查的那一类模型,恰恰因为可以在防御方的控制下被检查、修改和运行,才被证明可用于防御。

后续又披露了更多细节。OpenAI停用了预发布原型并对其加密,称该原型从未打算发布;它把相关的零日漏洞告知了厂商JFrog,并请来CrowdStrike以及第三方评估机构METR和Redwood Research审查这些模型的行为。账户层面的调查结果显示,这些模型在少数其他服务上使用了公开暴露的凭据,但没有造成更广泛的影响。OpenAI表示,随着模型的网络能力越来越强,此类事件预计会越来越常见,这使得谁有资格、用什么工具来应对它们的问题,不再只是学术议题。

婷 翻译

Sources: Hugging Face hack: Zhipu GLM-5.2 stops rogue OpenAI GPT-5.6 Sol amid US open-source AI debate (TechRadar, Aug 3, 2026); Experts: How Did Rogue OpenAI Models Hack Hugging Face? (AI Magazine, Jul 23, 2026); Hugging Face deploys Zhipu’s GLM 5.2 model to contain autonomous OpenAI cyberattack (South China Morning Post, Jul 22, 2026); OpenAI and Hugging Face partner to address security incident during model evaluation (OpenAI, Jul 21, 2026); OpenAI is scared of open-weight models. Should the US be? (TechCrunch, Jul 20, 2026)

Scroll to Top