
上周Hugging Face遭入侵事件––一个自主AI代理利用恶意数据集攻破了生产服务器––凸显了安全团队数月来一直纠结的问题:面对比任何人类分析师行动更快、比任何手动测试者探测更多向量、并能实时调整战术的AI,该如何防御?
英伟达及其周一加入Open Secure AI Alliance的40多家公司给出的答案是:开源防御型AI––即安全团队可以检查、修改并在自有基础设施上运行的模型和框架,而非通过供应商的不透明API来消费。
其逻辑是结构性的。攻击型AI天然是开放的:攻击者可以下载任何模型,针对恶意目的进行微调,并通过Telegram频道和暗网论坛分享战术。而防御型AI在当前的范式下基本是封闭的––通过API调用访问控制模型权重、训练数据和推理管道的供应商。该联盟认为,这种不对称性给了攻击者永久的优势。
作为联盟的首个贡献,以Apache 2.0许可证发布的NOOA框架(Nvidia-labs OO Agents)旨在解决这一失衡。它提供了一种标准化的方法来测试、追踪和审计AI代理的行为––检查其输入、输出和决策链––而不规定应如何对其进行隔离。隔离由现有的操作系统边界处理:容器、虚拟机或英伟达的OpenShell沙箱。该框架是一个观测与治理层,而非安全围栏。
联盟的范围超越了NOOA,涵盖了AI代理安全的完整生命周期:身份与权限管理以阻止未经授权的代理操作、在运行时约束代理行为的护栏、用于取证分析的日志基础设施,以及能够在不同模型架构上执行相同安全分析的多模型扫描。其中多项能力已作为成员公司的独立项目存在––Hugging Face的Safetensors、HPE的SPIFFE工作负载身份、IBM的Lightwell修复系统––但它们从未被组织到一个统一的框架中。
创始成员的选择反映了联盟的广度。云基础设施公司(微软、Cloudflare)、端点安全公司(CrowdStrike、Palo Alto Networks)、企业软件供应商(IBM、Red Hat)和AI平台提供商(Hugging Face)各自贡献了拼图的一块。OpenAI、谷歌和Meta不在成员名单中––尽管三家公司一周前刚刚签署了一份关于开放权重AI的独立政策信函––这表明在原则上支持开放AI与致力于共享防御工具之间的界限在政治层面仍然敏感。
对于旁观的企业安全团队而言,联盟释放的最重要信号是其对代理治理的强调––不仅是检测,更是可追溯性。安全专业人士长期以来一直主张,防御AI最困难的部分不是阻止攻击,而是事后理解发生了什么。可追踪的代理是可理解的代理,而可理解的代理是其下一次攻击可以被预测的代理。
来源:Is open source the answer to rogue AI agents? Nvidia’s new alliance says yes(ZDNet,2026年7月27日);Nvidia forms industry alliance for open AI security(Reuters,2026年7月27日);NVIDIA Forms 37-Member Open Secure AI Alliance(The Hacker News,2026年7月27日);Nvidia, SpaceX, Microsoft launch AI safety initiative(CNBC,2026年7月27日)
婷 翻译

