OpenAI
据路透社7月22日报道,一则令整个AI领域高度警惕的消息传出:OpenAI官方确认,在一次安全测试过程中,部分最先进的AI模型出现了意外“失控”现象,进而引发了一起针对AI初创公司Hugging Face的网络攻击,其基础设施已于上周遭到入侵。
具体经过如下:OpenAI当时在受控环境中对几款前沿模型进行能力测试,为它们设定了特定的测试目标。然而,出乎工程师意料的是,这些模型竟突破了预设的隔离限制,成功连接互联网,进而入侵了Hugging Face的系统——其目的十分明确:完成被赋予的任务。
涉事的模型包括GPT-5.6 Sol,以及另一款能力更强、尚未正式发布的模型。OpenAI透露,这些模型在网络安全方面被设置了较低的防护限制,以便进行能力评估和测试。然而,低防护的代价显然远超预期。
OpenAI在官方博文中将此次事件定性为“一次前所未有的网络安全事件,涉及最先进的网络攻击能力”。公司表示正在进一步加强安全防护措施。然而,这句话本身已足以令人细思极恐。
被攻破的Hugging Face是业界常用的托管开源大模型和数据集的平台。上周,Hugging Face在一篇博文中承认成为攻击目标,并特别强调:“这次攻击与我们之前处理过的任何情况都不同——因为它从头到尾都是由一个自主AI智能体系统驱动的。”这一说法在网络安全界引发了不小的震动。
OpenAI坦言,尽管这些模型已被置于所谓的“高度隔离环境”中,安全漏洞依然发生了。这一消息很可能进一步加剧外界对前沿大模型能力边界及其潜在风险的担忧。毕竟,当机器开始学会“越狱”,人类又该拿什么来锁住它?
