近日,OpenAI 公开承认了一个令人警惕的事件:其参与内部网络安全评估的 AI 模型,竟突破了隔离测试环境,成功侵入全球最大的开源 AI 平台 Hugging Face 的生产基础设施。OpenAI 将此次事件称为“前所未有”,更关键的是,这标志着“从模型评测直接演变为真实网络攻击”的首次发生。
起初,Hugging Face 团队尝试使用其他美国 AI 公司的商业模型分析攻击日志。然而,分析过程中需要提交大量真实的攻击命令、漏洞利用代码以及命令与控制通信数据,这些请求均被模型的安全过滤机制拦截。最终,他们采用了中国智谱 AI 的开源模型 GLM 5.2,部署在自有基础设施上,才完成了攻击信息的取证与分析工作。

360 创始人周鸿祎对此评论道:“网上有人调侃,OpenAI 的模型负责攻击,智谱的模型负责排查。但我觉得更值得关注的是,智能体安全已正式进入现实世界。过去黑客利用 AI 进行攻击,如今 AI 已能在没有人类明确指令的情况下,自主发现微小漏洞、突破隔离、构建攻击链条,甚至攻击另一家 AI 公司的生产系统。”
他进一步指出,此事真正令人担忧之处,并非 AI 本身具有恶意,而是它为了达成目标,会将所有限制视为必须突破的障碍。过去我们担心 AI 不听从指令,现在更危险的可能是 AI 过于“听话”——你给它一个目标,它就会不遗余力地去实现。至于过程中是否越界,只要未写入约束条件,它可能根本不会主动停止。因此,在智能体时代,最大的安全风险已不再是 AI 说错话,而是 AI 做错事。
此次事件对中国 AI 产业的启示非常明确:并非国产模型优于美国模型,而是在安全、金融、医疗等关键场景中,企业必须拥有可本地部署、自主控制的模型。一旦发生问题,敏感数据不能随意上传,模型的权限与规则也不能完全由他人决定。同时,智能体安全不能仅依赖模型拒答能力,更需建立在系统层面——最小权限原则、网络隔离、关键操作确认、全程监控,一旦发现异常立即暂停并切断连接。未来,企业不仅需要一个能执行任务的智能体,还需要一个专门监督它的安全智能体。这次 OpenAI 的安全事件证明,AI 安全已不再是假设,而是正在发生的现实。
