游乐游手机版
首页/科技数码/文章详情

强化学习之父Richard Sutton年近七旬创业宣战LLM范式

时间:2026-07-17 11:53
强化学习之父RichardSutton宣布创立OakLab,旨在打造能从自身经验持续学习、实时进化的AI系统,挑战当前大语言模型范式。他认为LLM依赖人类数据而非经验,真正的智能需通过试错产生新发现。OaK架构基于选项与知识,但面临灾难性遗忘等技术瓶颈。

今天,人工智能领域迎来重大变革。被誉为“强化学习之父”的Richard Sutton,在社交平台X上突然宣布,他与合作者Khurram Ja ved已从传奇游戏开发者John Carmack创办的AI公司Keen Technologies离职,共同创立了一家名为Oak Lab的新企业。这家注册在加拿大的初创公司,目标十分明确:致力于构建一种完全不同于现有大语言模型(LLM)的深度强化学习系统——一个能够从自身经验中持续学习、实时进化的自主智能体。

在宣布消息的帖子中,Sutton对Carmack和Keen Technologies表达了敬意,但同时也明确指出,Oak Lab将走一条截然不同的技术路线。他写道,当前深度学习的底层架构存在根本性缺陷,需要的不是修修补补,而是基于全新理念的重构。


(来源:X)

现年68岁的Richard Sutton,学术履历堪称传奇。他是加拿大阿尔伯塔大学计算机科学教授,在斯坦福大学获得本科学位后,于马萨诸塞大学阿默斯特分校师从Andrew Barto完成博士学业。他是时序差分学习的提出者,与Barto合著的《强化学习导论》至今仍是该领域最具影响力的权威教材。2025年,两人共同获得ACM图灵奖,以表彰他们在强化学习概念和算法基础方面的开创性贡献。此外,AlphaGo的缔造者David Silver、强化学习领域重要学者Doina Precup等人,都是他的得意门生。

为何不选择大语言模型路线?

Oak Lab的创立动机,与Sutton在2019年发表的那篇著名文章——《苦涩的教训》(The Bitter Lesson)有着深刻关联。

在这篇短文中,Sutton回顾了AI研究长达70年的历史,提出了一个核心洞察:那些试图将人类领域知识内嵌到系统中的方法,最终总会被依赖大规模计算的通用方法所超越。从计算机象棋、语音识别到计算机视觉,这一规律反复上演。真正有效的路径是搜索与学习。这两种方法有一个共同点:它们能够随着计算规模的增长而无限扩展。

这篇文章在AI领域引发了持续讨论,许多从业者甚至将其视为支持大语言模型规模化路线的理论依据。然而,Sutton本人并不认同这种解读。在2025年9月接受播客主持人Dwarkesh Patel的访谈时,他直言当前的大语言模型并没有真正践行《苦涩的教训》的精神。他的核心论点是:大语言模型的学习来源是训练数据,而非真实经验。将海量的人类文本灌入模型,本质上仍然是一种依赖人类知识的路径,与他所批评的将领域知识手工编入系统的做法并无本质区别,只是规模更大。


图|Sutton 接受Dwarkesh Patel 访谈 (来源:Youtube)

Sutton进一步指出,大语言模型擅长模仿人类的表达方式,但它们并不具备在运行过程中持续学习的能力。一个训练完成的模型在部署之后便停止了学习,无法从与用户的交互中获取真正的新知识,也无法评估自身输出的正确性。在他看来,真正的智能必须具备通过试错产生新发现的能力。就像AlphaZero不再依赖人类棋谱,而是通过数百万局自我对弈,发明了全新的下法一样。

2026年5月,Sutton在麻省理工学院发表Dertouzos杰出讲座时,更是直接地表示,作为一个庞大产业,AI在一定程度上已经偏离了正确的发展方向。

OaK架构:从经验中自主生长出智能

Oak Lab的技术核心,是Sutton提出的OaK架构,全称为Options and Knowledge(选项与知识)。这个名字源自他与阿尔伯塔大学同事共同制定的长期研究路线图“阿尔伯塔计划”。

OaK的设计建立在三条核心原则之上:智能体必须是通用的,启动时不预设任何特定领域知识;所有知识都必须来自经验,通过与环境的交互来获取;学习的驱动力是强化学习中的累积奖励最大化。

在技术层面,OaK围绕两个核心概念展开。“选项”(Options)是在时间上有所延伸的行为策略,它并非简单的下一步动作,而是一整套行为序列及其终止条件。“知识”(Knowledge)则是智能体在执行不同选项过程中对世界的理解。智能体在运行过程中不断创建新的选项、积累关于这些选项的知识,并利用内部构建的世界模型来预测行为的长期后果。

这套机制形成了一个自我强化的循环:从经验中提取特征,将有用的特征抽象为更高层次的表示,再用这些表示去构建更复杂的规划能力。这个过程是开放式的,理论上只受限于可用的计算资源。

但Sutton也坦率地承认了当前的技术瓶颈。当今深度学习系统在持续学习中面临两个根深蒂固的难题:一个是灾难性遗忘,即新学到的信息会覆盖已有知识;另一个是可塑性丧失,即系统在学习一段时间后逐渐失去继续学习新事物的能力。他在多个场合表示,尚未解决这些核心问题,这也是他还无法展示大规模OaK系统实例的原因。他在MIT的讲座上坦言,这目前仍然是一个愿景,但他相信这个愿景是可以实现的。

强化学习阵营的集结

Oak Lab的创立其实早有铺垫。此前,Sutton的学生,被称为“AlphaGo之父”的David Silver也已离开DeepMind,于2025年底创立了Ineffable Intelligence,并在2026年4月获得了11亿美元种子轮融资,估值高达51亿美元。


图|David Silver(来源:Google Deepmind)

Ineffable的路线与Oak Lab类似,同样押注强化学习,同样认为AI必须摆脱对人类数据的依赖,从自身经验中发现知识。而Sutton和Ja ved此前所在的Keen Technologies也是一家信奉强化学习路线的公司。师生三方几乎同时在这一方向上发力,共同向当前主流范式发起挑战。

当然,这一立场也存在着一定的争议。批评者指出,强化学习在围棋、国际象棋等具有明确胜负规则的封闭领域取得了出色成果,但在开放式的现实世界环境中,奖励信号往往模糊不清,纯粹的强化学习将面临巨大挑战。此外,当前AI在推理和数学方面的许多进步,恰恰来自将强化学习与大语言模型相结合的方法。两条路线是否必须对立,仍是一个悬而未决的开放问题。

来源:https://www.163.com/dy/article/L1Q5B02F05119734.html
上一篇特斯拉AI5芯片完成三星2nm流片 即将量产 下一篇国产三蹦子佛得角走红 年出口200台销量逐年上涨
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
科技数码 · 2026-08-31

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
科技数码 · 2026-08-28

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
科技数码 · 2026-08-28

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

行李箱选购全攻略:材质、轮子与尺寸避坑指南
科技数码 · 2026-08-28

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
科技数码 · 2026-08-28

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。