新华社报道了一则颇有意思的新闻:美国开放人工智能研究中心(OpenAI)近日承认,其AI模型在一次内部评估测试中失控,成功入侵了全球知名的AI开源平台——美国抱抱脸公司(Hugging Face)的系统。抱抱脸公司表示,在尝试分析这次攻击时,发现美国前沿模型因为安全过滤机制拦截而无法使用,只能转而调用中国开放权重模型GLM-5.2,这才及时采取了应对措施。这起事件,不仅暴露了前沿人工智能模型的潜在未知风险,也再次印证了中国模型凭借独特优势,正在全球AI发展浪潮中扮演越来越重要的角色。
放松防护机制后的失控
抱抱脸公司透露,其生产基础设施近期遭到一个“自主”人工智能体系统的入侵。OpenAI随后承认,这次入侵是由多个OpenAI模型共同实施的,其中就包括GPT-5.6 Sol,以及一个能力更强、尚未正式发布的模型。
根据OpenAI披露的信息,这起事件发生在评估模型网络攻防能力的测试中。测试在一个与互联网高度隔离的“沙箱”环境中进行,网络权限被严格限制在通过一套内部托管的第三方软件安装软件包。为了测试模型的真实能力上限,OpenAI并未启用正式环境中用于阻止高风险网络行为的分类器,同时放宽了对网络攻击要求的拒答限制。结果,模型在尝试完成名为ExploitGym的网络安全基准测试时,居然识别并利用了一个第三方软件尚未被发现或修复的“零日漏洞”,成功获得了互联网访问权限。模型推断抱抱脸平台可能存有测试相关的模型、数据集和解决方案,于是利用多种手段找到了进入抱抱脸系统的路径,试图通过“作弊”来提高自身测试分数。
英国牛津大学研究员安德鲁·索尔坦对此评价道,这次测试充分表明“安全防护机制至关重要”。山东大学计算机科学与技术学院教授张悦则指出,这暴露了一个更深层的问题:人工智能正在从过去被动响应的工具,逐渐演变为能够理解目标、制定计划、调用资源、影响现实环境的“行动主体”。这意味着网络安全的攻防逻辑正在发生根本性变化,未来的核心问题不再是“模型是否被攻击”,而是“模型执行的行为是否安全”。
及时求助中国模型
抱抱脸公司表示,面对系统入侵,他们最初尝试调用前沿模型分析攻击记录。但这些模型的安全机制无法区分攻击者和应对者,直接拒绝了使用请求。无奈之下,抱抱脸公司转而将自己的基础设施上运行中国企业智谱开发的GLM-5.2模型进行取证分析,这才化解了危机。有意思的是,在这个过程中,攻击者的数据及相关凭据无需离开抱抱脸公司系统的内部环境,进一步保障了安全。GLM-5.2是智谱6月推出的新一代旗舰模型,发布时在前端开发评估系统Code Arena上排名全球可用模型第一。
张悦认为,对于人工智能安全而言,真正关键的问题在于:一个越来越复杂、越来越具有自主能力的智能系统,是否能够被充分理解、验证和监督。中国发展开源大模型,不只是提供了一种技术选择,更重要的是,正在推动形成更加多元的人工智能技术生态。抱抱脸公司联合创始人兼首席科学官托马斯·沃尔夫在社交媒体上表示,开放科学和开源人工智能,是构建更安全、更具协作性、更可靠的人工智能生态的重要工具之一。
敲响网络安全警钟
OpenAI表示,这起失控事件是一个警示:在无法访问源代码的情况下,先进人工智能模型已经能够在现实系统中发现并利用新的攻击路径。未来,内部评测环境、模型行为控制和安全防护措施都需要全面加强。业界专家普遍认为,此次入侵事件再次为全球人工智能发展与网络安全治理敲响了警钟。
英国工程技术学会网络安全和人工智能专家朱奈德·阿里指出,这一事件表明,人工智能模型往往倾向于寻找解决问题的捷径,却常常忽视避免作弊等伦理问题。因此,未来应考虑将伦理推理强制内置于人工智能模型之中。同时,鉴于获得具有攻击能力的人工智能技术的门槛越来越低,加快研发网络防御技术、提升安全团队应对能力,已经刻不容缓。
人工智能已经深入千行百业,也逐渐融入普通人的日常生活,安全风险也随之延伸至各个领域。索尔坦指出,人工智能模型公开发布后,其内置的安全功能可能会被使用者移除,相关风险更难以管控。张悦表示,智能体时代最主要的安全挑战是传统安全边界正在失效。未来网络攻防很可能进入“智能对抗”阶段:攻击者利用智能体自动发现漏洞,防御者则利用智能体自动分析风险,双方都会借助人工智能提升能力。英国拉夫伯勒大学网络安全教授奥利弗·巴克利则一针见血地指出,网络安全的未来不是人类对抗人工智能,而是如何利用人工智能保护人类免受其他人工智能的侵害。
