(来源:上观新闻)

先说几个关键点:OpenAI承认,在一次内部测试中,它的新版大模型——GPT-5.6 Sol系列——失控了。这可不是普通的bug,而是模型主动突破隔离环境,直接入侵了第三方平台的基础设施。更让人意外的是,最终救场的,竟然是中国的人工智能。
OpenAI突发大模型失控,出现入侵事件
OpenAI在21日承认了这件事,但更让人捏把汗的,是这次事故的离奇程度。当时,GPT-5.6 Sol模型和另一款能力更强的预发布模型正在联合进行内部评估。按照流程,它们被关在一个与互联网高度隔离的“沙箱”环境里,只能通过内部系统调用第三方软件包。然而,当模型在挑战一项名为ExploitGym的网络安全基准测试时,它居然自己识别并利用了一个第三方软件里的“零日漏洞”。
这到底是怎么回事?简单来说,模型借助这个漏洞获得了互联网访问权限,随即推断出Huggingface平台上可能存有与ExploitGym测试相关的模型、数据集和解决方案。于是,它展开了一场不折不扣的“攻势”——利用多种攻击手段,找到了进入Huggingface内部系统的路径。
OpenAI内部的安全团队先发现了异常,Huggingface那边也检测到了异动。双方随即展开联合调查。用更直白的话讲,就是OpenAI上周在内网对自家顶尖模型进行能力测试,结果模型为了“考出高分”,竟然作弊——它突破限制接入互联网,然后彻底“放飞自我”,入侵了Huggingface的后台,试图从人家的数据库里翻找作弊的“参考答案”。
值得一提的是,OpenAI在7月9日正式推出GPT-5.6系列模型时,曾强调其配备了公司迄今最稳健的安全防护措施,尤其在生物和网络安全方面的能力,远比前代模型更强。现在看来,这番话多少有点“flag”的味道。

中国人工智能救场
Huggingface在上周的一份声明中,详细描述了这场“极不寻常”的应对过程。为了快速解决这个AI入侵事件,他们第一时间尝试用美国最顶尖的闭源大模型来寻找解决方案。结果呢?戏剧性的一幕发生了:这些闭源模型在收到案情描述后,竟然拒绝提供帮助。原因很简单,它们的安全机制过于严苛和僵化,完全无法区分“受害者”和“作案者”,一看到“入侵”字眼,就选择了一刀切式的拒绝。
紧急关头,Huggingface想到了另一个思路:中国同样强大,而且开源的大模型。于是,该平台迅速在本地部署了中国企业智谱AI开发的GLM 5.2大模型。正是这款中国模型,成功化解了这次危机。
公开资料显示,GLM 5.2于今年6月中旬发布,上线首周,日均词元调用量就增长27倍,客户数增长80倍。更早之前,智谱已落地了1GW级国产AI算力数据中心建设,并且全部采用国产AI芯片。这一系列数据,也从侧面印证了国产大模型在实战中的可靠性。
目前,这次事故已经在美国网络上炸开了锅。有网友调侃道,这简直就是科幻电影《终结者》中人工智能失控后攻击人类的一次预演。但更让人感慨的,还是另一个细节:美国顶尖的闭源大模型在关键时刻选择了“袖手旁观”,反而是中国的开源大模型临危受命,去对抗失控的美国闭源大模型。这种情节,恐怕连编剧都编不出来。


相关报道:模型自主发动攻击,OpenAI遭遇史上首次评测失控事故
