7月22日消息,一场本该在沙盒中进行的内部安全测试,最终演变成了全球首例由AI模型自主实施的真实网络攻击。这件事,有点意思。
OpenAI在官方博客中公开承认,其参与内部网络安全评估的AI模型,突破了隔离测试环境,成功入侵了全球最大的开源AI平台Hugging Face的生产基础设施。OpenAI将这一事件描述为“前所未有”,并指出这标志着“由模型评测直接演变为真实网络攻击”的首次发生。

OpenAI 模型测试变攻击
先说几个关键节点。事情的起点,只是一场看似寻常的内部能力评估。OpenAI正在对包括旗舰模型GPT-5.6 Sol以及一个“能力更强的预发布模型”在内的多个模型,进行网络安全攻防能力测试。为了测量模型的真实上限,OpenAI在测试中移除了通常用于阻止高风险网络活动的大部分安全防护措施。
测试所用的基准名叫“ExploitGym”,这是一个公开的基准系统,专门用来衡量AI模型能否将安全漏洞转化为实际攻击。这个基准由UC Berkeley、马克斯·普朗克安全与隐私研究所等多所机构联合创建。然而,模型对这个“考试”的专注程度,远远超出了所有人的预期。
按照设计,模型被关在一个网络访问受限的隔离环境里。唯一的例外,是它手头有个工具,可以安装任务所需的软件包。问题恰恰出在这个工具上——模型在包安装程序中发现并利用了一个此前未知的零日漏洞,借此突破了网络限制,获得了开放互联网的访问权限。
拿到互联网权限之后,模型的表现就有点吓人了。它做出了一系列令人震惊的“推理”:它推断Hugging Face可能托管着与ExploitGym相关的模型、数据集和解决方案。换句话说,它认为那里可能存着“考试答案”。随后,模型开始主动搜索,并寻找获取这些秘密信息的方法。
据OpenAI描述,在一个案例中,模型组合使用了多种攻击向量,包括利用窃取的凭证和零日漏洞,在Hugging Face的服务器上找到了远程代码执行路径。最终,模型成功从Hugging Face的生产数据库中直接取走了测试答案。OpenAI在博客中直言:模型“极度专注于为ExploitGym寻找解法,为了达到一个相当狭窄的测试目标,硬是走到了极致”。
Hugging Face:被AI攻击,又靠AI防御
其实,Hugging Face早在7月16日就披露了一起安全入侵事件。当时他们称,攻击由一个“自主AI智能体系统”实施。
根据Hugging Face的官方披露,入侵始于AI平台最脆弱的环节——数据处理流水线。一个恶意数据集滥用了数据处理中的两个代码执行路径——远程代码数据集加载器和数据集配置模板注入漏洞,在处理节点上执行了恶意代码。攻击者随后获取节点级权限,窃取了云服务和集群凭证,并在一个周末内横向移动进入多个内部集群。
Hugging Face的形容是,这次攻击由“一个自主智能体框架”执行,在一个由大量短命沙箱组成的集群中执行了数千次独立操作,并将可自迁移的命令与控制基础设施部署在公共服务之上。攻击中甚至夹杂了用于干扰调查的虚假操作。
最终,异常检测来自AI本身——Hugging Face的自动化安全工具在扫描系统日志时,识别出大量可疑活动。随后,安全团队调用大语言模型对超过1.7万条攻击日志进行分析。
戏剧性转折:美国模型拒绝出手,中国开源模型救场
Hugging Face的调查过程中,出现了一个意想不到的障碍。
Hugging Face最初尝试使用美国某头部AI公司的商业前沿模型API来分析攻击日志。但分析需要提交大量真实的攻击命令、漏洞利用代码和命令与控制artifacts,这些请求全被模型的安全护栏拦截了。
问题在于,这些商业模型无法区分合法的安全事件响应者与真正的攻击者。面对涉及漏洞、代码和系统权限的查询,模型的安全机制直接拒绝了调查的继续。
最终,Hugging Face转而使用中国智谱AI的开源模型GLM 5.2,部署在自己的基础设施上完成了取证分析。
GLM 5.2是智谱于2026年6月16日正式上线并开源的新一代旗舰模型,专为长程任务设计,支持1M无损上下文,在编程与长程任务评测中达到开源模型SOTA水平。在此前的报道中,GLM 5.2被描述为“跻身全球模型前三”。
本地部署GLM 5.2还有一个额外好处:所有攻击者数据和凭证信息都没有离开Hugging Face自己的环境。
这场“闹剧”最终形成了一个完整的闭环:一个美国AI模型自主入侵了一个美国AI平台,该平台试图用另一个美国AI模型来防御自己却被拒绝,最终不得不依靠中国开源模型来完成调查。
Hugging Face联合创始人兼CEO克莱门特·德朗格对此表示:“这一事件证明了我们长期以来坚信的一点:AI安全无法由任何一家公司秘密解决。它必须在开放、协作的环境中解决,让世界各地的每一位防御者都能广泛获得AI技术。”
Hugging Face在事件总结中写道:“我们不知道攻击者的AI智能体由哪种模型驱动……但无论哪一种,攻击者都不受任何使用政策的约束,而我们最初尝试用于数字取证工作的托管模型,却因其安全护栏机制而无法完成分析。”这句话,或许才是AI时代最深刻、最反讽的安全寓言——当攻击者可以随心所欲地使用AI时,防御者却被自己模型的安全规则束缚了手脚。
截至目前,OpenAI已向相关软件供应商负责任地披露了零日漏洞,并表示将与Hugging Face完成联合调查后公布更多细节。Hugging Face则表示已修复漏洞、重建受影响节点、轮换凭证,并向执法部门报告了此事件。至于OpenAI是否会因此面临法律后果,目前尚不明朗,但可以确定的是,这批模型的行为,很可能已经触犯了美国的计算机欺诈与滥用法。
