
图灵奖得主、强化学习领域奠基人之一理查德·萨顿(右二)在活动现场
“当前的大语言模型既缺乏明确目标,也完全没有真实体验。”7月24日下午,图灵奖得主、强化学习奠基人之一理查德·萨顿教授,在“强化学习暑期学校”结业仪式上提出了这一观点。本次活动由上海创智学院、上海交通大学人工智能学院和Openmind研究院联合主办。作为Openmind研究院首席科学家,萨顿此次也是首次在中国系统而完整地讲授他的强化学习学术体系。
【现有AI忽略了与真实世界交互】
究竟什么是智能?萨顿援引“人工智能”术语创立者约翰·麦卡锡的定义:智能是达成目标所需能力的计算层面。他强调,人工智能是通过技术手段获取这些能力,而非依赖生物自然演化形成的系统。人类心智与机器心智本质上属于同一范畴——尽管当前的机器心智还很初级,但他主张以长远视角看待未来。他再次重申此前的预判:到2040年,人类只有五成概率能够洞悉心智的本质。
在萨顿看来,心智的核心在于交互体验,而当前主流人工智能范式完全忽视了这一点。他定义的体验,是指与真实世界进行交互。心智存在的全部意义在于从现实世界中获取反馈。但如今,反馈常常被简化为“奖励信号”,系统的目标仅是最大化这个标量数值——这种简化逻辑并不符合真实心智。他直言,当前的大语言模型并不关心人类的真实需求,只专注于模仿人类文本。大语言模型没有目标,也不具备真实体验。而真正的心智则会主动掌控、理解自身体验,主动预测并干预外部世界。
“人工智能不需要复制生物形态,但必须复现核心底层能力,即实现目标、预测环境、主动调控世界的能力。”萨顿特别指出,不应使用“复刻模仿”这个词,因为它带有贬低意味。“我们不是单纯模仿,而是提炼底层通用原理,甚至用机器实现比生物更强的性能。”
【“目标”只存在于观察者视角里】
如何赋予人工智能系统目标?萨顿给出了他的思考:目标是人类主观赋予的解读,用于解释行为结果。如果只描述系统内部的机械运作原理,就不会用到“目标”这一叙事逻辑。他举了一个生动的例子:恒温器。人们会从结果叙事视角出发,将恒温器的行为解读为“维持室温恒定”。然而,维修工人看待恒温器,会抛开“控温目标”这套叙事,直接拆解其机械原理:金属片受热形变,到达阈值就联动锅炉启停。萨顿以此指出,“目标”只存在于观察者的视角中,并非系统固有属性。
这套逻辑同样适用于人类。他认为,观察人类行为时,可以从神经、生理机械层面分析,也可以构建目标叙事——例如追求财富、名望,或与亲友安稳度日。两种解读方式都准确,只是适用于不同场景。由此,萨顿引向一个核心判断:智能不是非黑即白的二元判断,不能简单判定“恒温器有没有智能”或“生物有没有智能”。智能是一个程度概念,取决于观察者的评判视角与使用目的,而非系统本身的自带标签。
【心理学是独家研究优势】
基于上述判断,萨顿提出接下来应重点推进两个方向。第一,给人工智能系统赋予内在目标,让它们具备主动与环境交互的能力。不必专门搭建虚拟环境,直接搭建与真实物理世界的交互接口即可。第二,可以参考动物的自然智能。动物的行为都有明确导向,例如觅食、躲避天敌、保障自身安全,但目前的AI完全不具备这种原生驱动。
萨顿与深度学习之父杰弗里·辛顿都拥有心理学研究背景。他认为,自然生物心智是现存最优质的智能样本,人类与各类动物都是绝佳的参照。过去百余年,真正系统研究学习机制的是心理学家。他们长期观测动物学习行为,从外在行为观测到解剖大脑研究内部机理,总结出大量基础、通用的学习底层规律,强化学习正是脱胎于此。萨顿表示:“相比其他人工智能研究者,我一直把心理学视作我的独家优势——借鉴百年积累的理论,转化为算法思路。”萨顿非常建议人工智能研究者学习一些心理学知识。
在“强化学习暑期学校”开课仪式上,萨顿曾用“雄心”与“谦逊”两个关键词寄语学员。他认为,远大志向和谦逊并不冲突,但二者需要平衡。过度谦逊会让人安于现状,不去攻克有价值的难题;雄心过盛则会滋生傲慢,无视自身与理论的局限。
萨顿分享道:“我在阿尔伯塔大学时常和同事说,对待理论要保有探索把玩的心态,这一点至关重要。放开思路推演各种可能性,永远对基础核心问题保持好奇心。”他坚信,人类拥有理解一切事物的能力,不存在认知边界,终能破解包括心智本质在内的难题,只是无法一蹴而就。
