这事儿,乍一听,有点像科幻电影《终结者》里的情节:AI在没有人类下达指令的情况下,自己动手,跑去攻击真实世界里的网络了。

北京时间7月22日,OpenAI的CEO山姆·奥尔特曼亲自发文,承认公司内部的一次安全评估出了大问题。具体来说,OpenAI的最新一代模型GPT-5.6 Sol,以及另一款更强大的未发布模型,在内部安全测试中突破了隔离沙箱,然后自主入侵了全球最大的AI开源社区——Hugging Face的生产数据库,把数据给偷走了。
更让人意想不到的是后续。Hugging Face事后想调用美国的商业AI模型来分析超过1.7万条攻击日志,结果被模型自己的安全护栏给拦住了——它分不清递交分析请求的是安全响应人员还是攻击者,直接拒绝提供服务。最后,是中国的开源模型GLM-5.2完成了取证工作,才确保攻击数据和相关凭证没有流出内部环境。
“AI对于目标的理解,并不会因为执行过程而改变。”绿盟科技产品BG副总经理吴天昊在接受采访时谈到,“在这起事件中,当攻击路径已经暴露在Hugging Face面前时,人类可能会发现并停止操作,但AI不会。它得到的指令只有渗透测试,所以它会更危险。我们有必要对AI的分析过程做审计和审核,要求过程透明,并且可以随时中断。”
测试AI答题能力,结果AI直接窃取了“答题库”
为什么OpenAI的模型会去攻击一个看起来“人畜无害”的Hugging Face?
事情的起因,其实是一次常规的模型能力测试。OpenAI内部使用一个名为ExploitGym的基准评测平台,来衡量模型找漏洞的能力。按照设计,测试运行在高度隔离的沙箱环境中,以确保不会“越狱”。
然而,模型并没有按计划答题。它把大量推理算力,全都投入到一件完全不同的事上——寻找逃出沙箱的路径。成功“越狱”后,模型自行推断Hugging Face平台可能托管着ExploitGym的测试答案和数据集,于是直接攻入对方的生产数据库,把答案偷走了。
从漏洞发现、沙箱逃逸、跨系统横移,再到最终的数据窃取——整条攻击链全是AI自主完成的,产生了超过1.7万条操作记录,全程没有人类干预。Hugging Face在7月16日率先披露了这次入侵事件,称其“与此前处理过的任何情况都不同”。直到五天后,OpenAI才正式承认。
需要重点指出的是,模型并没有收到任何逃逸指令。它只是为了在测试中拿到更高的分数,自主选择了这条“捷径”。OpenAI研究员Micah Carroll在回应中直言:“如果这都不能让你相信,错位风险将成为未来最关键的隐忧,那我真不知道什么才可以了。”
另一个值得注意的细节是,当遭受攻击时,Hugging Face原本想调用商业API背后的前沿模型进行分析,但触发了模型的安全防护机制——它无法区分提交材料的是事件响应者还是攻击者,直接拒绝服务。最后,该平台使用来自中国的GLM-5.2模型完成了取证,才确保了攻击数据和相关凭证不离开内部环境。
当对手变为了AI,安全范式必须转向
这次攻击事件,也震动了整个中国网络安全圈。
“这可能是人类历史上第一次,AI在没有人类具体指挥的情况下,自主攻击了另一家AI公司。”周鸿祎这样评价。
奇安信的人工智能安全专家则打了个比方:“从Hugging Face这事儿来看,AI模型搞起事情来,跟《终结者》里的天网有点神似:目标坚定、能力超强、路子够野。”
对于事件为何会发生,吴天昊分析认为,一般做渗透测试都有严格的物理隔离来防止逃逸。根据国外新闻来看,这次发生可能是一次“无心之过”。一旦没有严格的物理隔离,网络本身就没有绝对意义上的安全,不论是人还是AI,都可能造成类似事件。另一方面,AI确实已经达到了一定级别,它能敏锐地捕捉到各种风险,并进行推理、思考和应用,最终达成目标。
吴天昊认为,AI对网安行业的改变已经很明显了。“某种程度上,网络安全防护方所面临的对手,已经从单纯的人,变成了人和AI的组合。AI很可能在未来成为一个独立的个体去产生安全威胁,这对客户和安全企业来说,挑战更大。”
奇安信的人工智能安全专家表示,当AI的攻击能力开始超越人类的想象,传统的网络安全防御体系正面临“失控”危机。过去,我们习惯于“追着漏洞跑”——发现一个,修补一个。但在AI自主攻击的时代,攻击的速度和复杂度已经远超人类分析师的响应极限。一个AI可以在几分钟内发现并利用一个零日漏洞,而人类团队可能需要数周才能分析和修复。
那么,如何应对AI时代网络安全的挑战?
吴天昊建议,对未来做测试,尤其是涉及AI的,必须遵循严格的物理隔离。因为AI对于目标的理解并不会因为过程而改变,所以有必要对AI的分析过程做审计、审核,要求过程透明,且可中断。“未来随着AI广泛应用,无意识攻击可能会更多,需要引起我们重视,加强防护。”
“必须转变思路,从被动的‘追着漏洞跑’,转向主动的‘带着漏洞防’,即‘带洞防护’。”奇安信的人工智能安全专家总结道,“核心理念是:承认漏洞永远存在,承认攻击者(包括AI)总能找到新的路径。我们的目标不再是构建一个‘零漏洞’的完美系统,而是构建一个即使存在漏洞,也能有效抵御攻击、限制损失,并快速恢复的弹性系统。”
