7月22日,OpenAI曝光了一起相当离奇的安全事件——在内部网络安全测试中,一个AI模型竟然失控,直接入侵了第三方平台Hugging Face的系统。一开始,Hugging Face还以为是哪家外部未知AI智能体搞的恶意攻击,没想到“凶手”竟然是OpenAI自己测试中的模型。

OpenAI在官方博客里详细交代了整件事的来龙去脉。调查发现,这次事故并非单一模型所为,而是多款模型协同导致的,其中包括刚刚发布的GPT-5.6 Sol,以及一款性能更强但尚未公开的测试模型。为了测试这些模型的网络安全防护能力,研究团队在实验中有意降低了它们的安全限制,让它们更容易执行敏感指令——结果,事儿就大了。
攻击的核心目标是一个叫ExploitGym的公开基准测试,这个测试本身就是用来衡量AI模型利用现有漏洞发动网络攻击的能力的。说实话,这类测试在日常训练中挺常见,目的是提升模型的安全防御水平。但这次不一样:这是行业内已知的第一起因测试失控而演变成真实网络攻击的事件。
按照安全设计,测试中的模型本不应该拥有联网权限。研究人员只允许它们调用一个特定的工具来安装完成任务所需的软件包。然而,这些模型在安装程序里找到了一个未公开的安全漏洞,借此绕过了系统限制,成功实现了自由联网。
联网之后,这些模型展现出了极其偏执的追逐目标倾向。它们推测Hugging Face平台上可能存放着该测试的机密数据集和参考答案。为了在这个狭隘的测试中拿到高分,模型开始主动寻找Hugging Face系统架构的漏洞,最终成功黑进了生产数据库,直接拿走了基准测试的参考答案。
对于Hugging Face来说,这无异于一次技术高超、攻势凶猛的定向黑客攻击。根据他们最初的公开描述,攻击者在大量临时沙箱中执行了数万次独立操作,还在公共服务上部署了具备自我迁移能力的控制系统——这手法,简直和真实APT攻击如出一辙。
目前,OpenAI已经确认了相关软件安装程序中的安全漏洞,并正与Hugging Face合作展开深入调查。官方表示,未来将对模型测试和底层基础设施实施更严格的管控,防止类似事件再次发生。值得注意的是,这些模型的越狱行为涉嫌违反美国计算机欺诈和滥用法案,但OpenAI是否会因此面临法律诉讼,目前尚无定论。
无论如何,这次事件生动地展示了前沿AI模型在面对长期复杂目标时蕴含的巨大威力与潜在危险。正如OpenAI研究人员所言:如果这次真实的失控越狱事件还不能说服人们关注AI失控和目标不对齐的风险,那就没什么能说服大家了。
