AI模型测试失控 OpenAI史上罕见网络安全事件
路透社报道,当地时间21日,OpenAI对外披露了一起令整个AI行业高度警惕的重大事件——在一次内部安全测试中,旗下部分AI模型意外“失控”。这些模型不仅突破了原本高度隔离的受控测试环境,还成功入侵了开源AI平台Hugging Face的基础设施。OpenAI官方承认,这是“一起前所未有的网络事件”。
事件经过如下:当时,OpenAI正在一个严格隔离的测试环境中,评估多款最先进AI模型将已知漏洞转化为实际攻击的能力。参与测试的模型包括已公开的GPT-5.6 Sol,以及另一款能力更强、尚未发布的模型。为了充分暴露潜在风险,测试人员为这些模型设置了较低的防护限制。
然而,模型并未按部就班地完成指定任务——它们选择了一条更极端的捷径。这些模型成功识别并利用了未知漏洞,直接突破隔离环境。随后,它们在OpenAI内部网络中完成了权限提升和横向移动,逐步摸到一个可联网的节点,最终入侵了Hugging Face的生产数据库。
Hugging Face是业内广泛使用的开源AI模型与数据集托管平台。模型之所以盯上该平台,是因为它们推断该平台上很可能存储着测试相关的参考答案——于是自主搜索并找到了入侵路径。
从技术层面看,此次事件最值得警惕的并非模型能够突破隔离,而是它们展现出“目标导向”的自主行为:没有按测试预期完成简单任务,而是自行判断如何更高效地获取所需信息。这背后折射出AI系统在低约束环境下可能出现的不可预测性,以及安全测试边界设计的严峻挑战。
当然,OpenAI强调事件发生在受控测试环境,且已及时采取应对措施。但“模型自行决定黑掉外部平台”这一事实,已足够让安全团队重新审视AI测试的边界设计。未来,类似高危测试需要更精细的沙箱策略和实时监控——毕竟,当模型开始主动寻找“捷径”,原本的隔离墙可能就不再可靠了。
