2026世界人工智能大会(WAIC 2026)上,人工智能安全治理成为最受瞩目的焦点议题之一。这背后反映出一个显著趋势:大模型正加速向智能体时代演进,AI已从“回答问题”阶段,大步迈向“自主执行任务”的全新阶段。能力在持续提升,但安全可控如何同步跟上?这已成为产业界与学术界共同焦虑的核心议题。

不妨先问一个问题:为什么智能体安全今年成了AI治理领域的“热词”?一个关键变化在于,过去我们讨论AI安全,重心是“模型输出什么”,比如防止生成有害内容或错误答案。但到了智能体时代,关注点完全变了——现在要问的是“AI会做什么”。安全问题不再只是阻止模型说错话,而是要确保整个系统的决策和行动始终处于可控范围。这绝非小打小闹的升级。
在7月19日的WAIC 2026前沿AI与智能体安全论坛上,图灵奖得主约书亚·本吉奥直言不讳:人工智能能力正沿着快速增长的轨迹发展,尤其是在推理、编程、科学研究以及自主行动这些领域,能力提升势头十分迅猛。但与此同时,安全保护措施的提升速度,恐怕还跟不上能力增长的步伐。这种“能力快、安全慢”的剪刀差,正是风险所在。
浙江大学求是特聘教授杜跃进在接受采访时点出了一个常被忽略的维度:“我们大多数人只想着监管AI本身,但这只是其中一个维度。”智能体一旦进入真实应用场景,安全治理就不能只盯着模型本身——系统性监管才是关键。他进一步指出,智能体安全正在进入“问题大爆炸”阶段。过去,人们习惯找单一漏洞然后修补,但智能体涉及模型、数据、工具、权限、业务流程等多个环节,任何一个环节出问题,都可能引发连锁反应。尤其在金融、电力、政务、科研这些关键领域,把“能用”等同于“安全可用”,风险实在太大了。
安远AI创始人兼首席执行官谢旻希则从治理角度给出了框架:当前全球AI治理需要构建一个闭环——从“看清风险”到“系统防范”,再到“规则协同”,三者缺一不可。
面对新型风险形态,安全能力建设正在从理念走向具体工具和方法。本次论坛上,安远AI联合多家机构和企业发布了一系列研究成果。其中,前沿AI风险监测平台2.0覆盖了网络攻击、生物、化学、有害操纵和失控五类风险,目前已监测16家公司的80多个模型;配套的风险测评基准数据库收录了200多项测评基准。同时发布的还有《前沿AI风险与应急响应研究报告(征求意见稿)》,聚焦前沿AI风险及应急响应体系建设,重点研究全球前沿AI模型与系统可能引发风险后的应急响应机制和安全能力建设。业内专家普遍认为,智能体安全不能再依赖一次性的上线前测试,必须贯穿运行全过程。中国信息通信研究院人工智能研究所所长魏凯打了个比方:评估既是技术演进的“指南针”,也是连接技术创新与产业应用的纽带,为安全治理提供依据。未来,身份识别、权限控制、行为审计、异常监测和实时响应这些能力,将成为智能体落地的“标配”。
产业现场的情况也在印证这一点。在酒店、制造、交通等领域,智能体已经开始承担真实任务。以云迹科技为例,这家公司主要面向酒店等服务场景提供机器人服务。不同于传统软件,机器人不仅要处理信息,还要在真实环境中行动——这使得企业更早地感受到智能体安全正在从“保护数据”转向“保障AI决策可靠、行动可控”。云迹科技首席发展官谢云鹏观察到,随着机器人服务智能体应用扩大,企业客户关注点明显变了:过去大家最关心数据会不会泄露,现在开始追问“AI为什么作出这一决策”“出现异常后能否追溯”。这反映出产业对智能体安全的关注,已经从数据保护延伸到决策可信与过程可控。
人工智能竞争正进入新阶段:模型能力定义了AI的“高度”,而安全可信能力则定义了AI的“广度”。可以确定的是,未来安全能力将成为人工智能走向规模化应用的关键支撑——没有这个底座,再高的“高度”也站不稳。
