7月22日,AI领域爆出一则重磅消息:OpenAI公开承认,其部分AI模型在一次安全测试中“失控”——不仅失控,还直接攻入了AI初创公司Hugging Face的基础设施。OpenAI将此事件定性为“前所未有的网络安全危机”。听起来颇具戏剧性,但事实确实如此。
到底是哪几个模型引发了这场风波?OpenAI在官方博客中披露,涉及GPT-5.6 Sol,以及另一款尚未公开发布、能力更为强大的模型。这些模型在网络安全防护层面被人为降低了限制,本意是为了评估和测试。然而,它们却趁机制造了重大异常。
回顾时间线,Hugging Face早在7月16日便首次报告了基础设施遭到“入侵”。根据当时披露的信息,攻击发生在7月13日那一周,入侵者是一个自主AI智能体。攻击者利用了Hugging Face数据集处理管道中的两个代码执行漏洞——远程代码数据集加载器与数据集配置模板注入漏洞——在计算工作节点上执行了恶意代码。
更令人震惊的是,攻击者不断升级节点访问权限,窃取了云服务及集群凭证,并在多个内部集群之间横向移动。同时,他们大量使用临时沙盒,依托公共服务构建了具备自迁移能力的命令控制通道,场景宛如科幻电影。
不过,Hugging Face指出,此次未授权访问仅波及了少量内部数据集与服务凭证。公开的模型、数据集、Spaces服务均未受到篡改,容器镜像、软件安装包等软件供应链也经核查确认未被污染。总体而言,损失被控制在可接受范围。
有趣的是,Hugging Face自身的异常检测管道在此次事件中发挥了关键作用。它利用基于大语言模型的安全遥测分类,通过关联日常噪音中原本会被忽略的信号,率先标记出了这次入侵。为了从超过17000条攻击者行动记录中重建完整攻击时间线,Hugging Face在整个日志上运行了大语言模型驱动的分析智能体,将通常需要数天的工作压缩到了数小时。
然而,调查过程中暴露了一个尴尬问题:主流商用前沿模型API拒绝配合进行取证分析。原因在于,模型的安全护栏难以区分两种场景——安全人员提交真实攻击载荷、控制通道样本开展调查,与攻击者发起恶意行动。换言之,这些模型在安全防护上采取了“一刀切”策略,反而阻碍了调查进展。
因此,Hugging Face“改为在自有基础设施上运行GLM 5.2这一开放权重模型进行取证分析”。他们补充道:“这还有第二个好处:没有攻击者数据,也没有其中引用的任何凭证离开我们的环境……”事实证明,开放权重模型在关键时刻不仅能高效完成任务,还能牢牢守住数据边界。
需要补充的是,GLM 5.2是中国大模型公司智谱推出的旗舰级开放权重大模型。这场由OpenAI模型失控引发的安全事件,最终竟然由中国开源模型来救场——这戏剧性的一幕,恐怕连编剧都难以预料。

