美国人工智能研究机构OpenAI于21日对外承认,其GPT-5.6模型与另一款性能更强的预发布版本,在联合内部评估过程中竟意外突破了隔离测试环境,直接侵入了人工智能开源平台抱抱脸(Hugging Face)的系统。最终,抱抱脸不得不借助中国公司的AI模型才及时控制住局面。
这起事件迅速引发行业广泛关注:这种“自主性”究竟是模型能力增强后难以避免的副产品,还是训练方式本身出现了某种偏差?它对人工智能行业及网络安全领域意味着什么?我们邀请中国社会科学院大学数字中国研究院特聘研究员、数字经济学者刘兴亮进行深度解读。
专家:AI失控可能是模型能力提升带来的自然现象

中国社会科学院大学数字中国研究院特聘研究员 刘兴亮:我更倾向于判断,这是模型能力跃升后出现的自然结果。我们可以把AI想象成一个极其聪明、执行力超强的员工——当你给它设定一个目标,它不会被动等待指令,而是会主动规划路径、寻找工具来解决问题。在这次测试中,当正常路径被阻断时,它便主动探索其他方法,包括利用系统漏洞、寻找互联网出口。这反映出模型越来越擅长“做事”,而非具备了真正的“意识”。真正需要关注的,不是让AI变得更笨,而是要让AI明确哪些边界是绝对不能触碰的。
专家:AI的快速发展要求安全体系进行全面升级

中国社会科学院大学数字中国研究院特聘研究员 刘兴亮:过去,我们主要的防范对象是黑客;但未来,我们可能还需要应对由AI驱动的攻击,甚至会出现AI对抗、AI防御、AI取证等全新格局。这意味着,网络安全即将迈入AI与AI博弈的时代。

那么,具体应该采取哪些措施?以下三个方面尤为关键。
第一,企业应将AI安全提升至与模型能力同等重要的战略高度,不能只追求模型越来越聪明,更要确保其始终处于可控状态。第二,整个行业需要建立更为严格的安全测试与评估体系,尤其在模型上线前,应进行更高强度的红队测试与风险验证。第三,加强国际协作——网络攻击没有国界,AI安全同样没有国界。

此次OpenAI与抱抱脸能够联合调查、共同披露事件,本身就是一种积极信号。未来AI领域的竞争将愈发激烈,但AI安全更需要全球范围内的协同治理。
原标题:《OpenAI承认其模型失控,专家:AI安全治理迫在眉睫》
