让我们先回到一个关键节点:2024年,强化学习奠基人理查德·萨顿与导师安德鲁·巴托终于拿下了图灵奖。
说实话,这个奖来得不算早。过去三十年,萨顿的理论早已悄然支撑起AlphaGo、ChatGPT这些改变行业格局的系统。但真正有意思的是,他三十年前写下的那些理论,直到今天才被具身智能这帮人真正听懂——
智能体得从试错中学习,得从真实经验里进化。
2024年,萨顿参与创办了非营利研究机构Openmind。紧接着在2025年4月,他和团队联合发表了一篇文章,标题就直接点明了方向:《欢迎来到经验时代》。文章里有一句话,值得每个做机器人的人反复琢磨:
“新一代智能体,必须拥有像人类一样在长时间尺度上不断推进的经验流,在真实的物理反馈中实现自我进化。”
这话放出去,不止是理论层面的宣告。今年5月,萨顿与他山科技在加拿大正式签约,双方要长期合作,一起搞一个叫“机器人幼儿园”的项目。

一位图灵奖得主,和一家专注触觉的中国公司走到了一起。这个组合看上去跨度不小,但背后指向的是同一个判断:训练机器人的那条新路,很可能就藏在真实的触摸和试错里。
具身智能,缺的是“第一人称经验”
他山科技CEO马扬给出的判断很直白。机器人要干活,本质上就两件事:一是移动,靠双足、四足、轮子这些方案,很多公司已经做得不错了;二是操作目标物体——用手去抓、去放、去拧,动作得流畅,还不能被前一个动作的偏差打断。这两件事要是都能搞定,基本就能覆盖人类想交给机器人做的90%-95%的工作。
而他山科技从一开始就押注在后者,切入点就是触觉。
2017年公司刚成立那会儿,市面上大多数机器人厂商都在展示跑跳翻滚的能力。但别忘了,人类90%以上的物理交互,其实是靠手指完成的。手指跟腿不一样,它要不停地和不同物体接触,感知、决策、调整,这是个难度逐步递增的持续过程。
想把具身智能的“手指位置”解决好,触觉感知能力就是那个核心变量。这也是“让机器人真正干活”的底层方法论。在这条路上,他山科技一做就是将近十年。
目前主流的训练方向,依赖的是静态数据集下端到端的模仿,听着高级,但本质上就是套用题库。人类演示的数据,说到底属于第二人称经验——机器人在学人的做法,但它自己没法亲手“摸”出来,也就理解不了物理世界到底是怎么运转的。
他山科技很早就意识到这条路有天花板。就像人类幼年时得从模仿和实践中成长一样,机器人要“启蒙”,光靠模仿远远不够,它需要的是属于自己的第一人称经验。
在行动中感知后果,在反馈中调整行为——这种训练方式,可能是目前最接近让具身智能实现“自我训练”的方法论。
而这一判断,恰好和萨顿的想法不谋而合。
萨顿提出的“经验流”概念,核心要求就是智能体的学习过程和行为过程必须完全融合:每一次行动都是数据采集,每一次反馈都是训练信号。所以,能够提供第一人称体验的真实环境,就成了这个概念落地的关键。
但尴尬的是,这个想法长期只能停留在理论层面——原因很简单,真实的物理环境很难提供低成本、高频率、标准化的交互反馈。过去这些年,具身智能行业把精力主要放在了解决大脑和眼睛的问题上,一直缺少一个能精准感知物理接触的通道。
触觉,恰恰是物理交互中最核心的感知通道。机器人接触一个物体时,触觉传感器能实时反馈接触点的三维力分布、物体的局部形变以及滑移趋势。有了这些信息,机器人才能迅速调整力度和角度,决定该收紧还是放松。
好消息是,高精度的触觉感知技术正在不断涌现,补上了机器人曾经缺失的那条“传入神经”。萨顿这些理论先驱也开始重点关注这个领域。2025年11月,萨顿来中国走访,主动联系参访的两家具身智能企业里,就有他山科技。

萨顿走访他山科技
在他看来,他山科技是触觉感知赛道上技术储备最完整的公司。自研的触觉传感器,力分辨率能达到0.01N——这个精度,相当于一根头发丝掉到手指上的力度。凭借多年在AI触觉感知技术及全栈触觉解决方案上的研发积累,他山科技攻克了触觉多维感知信号同时解析这个全球性难题,构建起了“芯片-传感器-算法模型-场景应用”的完整技术体系。
当大多数触觉传感器厂商还停留在单一维度的力测量或简单的电容变化时,他山科技已经实现了三维力、材质识别、接近觉和协同感知的同步解析。
更关键的是,他们的触觉感知能力已经走通了量产这条路。过去两年里,产品进入商业化阶段,开始为主流灵巧手厂商批量交付。2025年,他山科技在人形机器人触觉传感器赛道拿下了超过80%的市场份额。

TS-VT视触融合训练平台
萨顿在他山科技参观完后,双方快速推进合作,除了方法论高度契合之外,还因为在这家公司的大楼里,他亲眼看到了一个已经把触觉感知从实验室推向产业落地的团队。
于是,在强化学习理论发布三十年后,理论和技术在具身智能领域完成了一次双向奔赴:学术泰斗找到了能把自己理论工程化的盟友,而他山科技也在触觉加速机器人训练这件事上,补上了最后一块理论拼图。
机器人幼儿园,在真实环境中“启蒙”
双方合作的具体落脚点,名字就叫“机器人幼儿园”。
这个想法的诞生挺有意思。萨顿在他山科技参观时,看到中国的小学生上机器人课,感触很深——国内的具身启蒙环境如此开放,人和机器人能更自然地相处。机器人幼儿园的构想由此萌生。
这套系统具体是什么?它是一套面向机器人持续学习的触觉与多模态经验训练平台,把真实物理环境、仿真环境、多台机器人本体、触觉与多模态感知设备、任务课程、数据采集和评测机制整合在一起,让机器人在反复接触、尝试、失败和修正中,形成可训练的经验。
为什么非要叫幼儿园?马扬的解释很形象:现在的具身智能,就像一个0到3岁的婴儿。我们在视频里看到机器人能做各种事情,觉得挺厉害,但实际上成功率并不高,而且它自己也不知道自己是成功还是失败。“它只是做出来了,人们就会鼓掌”。
问题就在这里。人类的正确示范,其实很难让机器人理解自己到底做对了什么。因为“正确”这件事本身很模糊,在一个很大的范围内都可以算对。只有错误是有边界的。足够多的错误实验,才能让机器人知道任务的边界在哪儿,下一次操作时该怎么调整。
“具身智能的安全感也不是大家一起画一条线界定出来的,而是它在客观交互中逐步探索出来的。”
这个比喻很到位。就像人的安全本能不是靠阅读手册获得的,而是在一次次接触、跌倒、调整中长出来的。机器人也一样,只有通过足够多的真实试错,它才能理解什么是不安全的。如果机器人能自己划出安全的操作边界,既能保护自身,也能演绎出对他人的安全性。
萨顿参访他山科技后,双方的合作推进得很快,2026年5月11日完成了正式签约。
签约仪式上,萨顿谈到了合作的意义:“早在我们读研究生的时候,就有人提出制造一个像婴儿一样的机器人,让它与世界互动并通过经验成长。这个想法在当时几乎不可能实现。现在我们有了足够的算力,也有了足够多的机器人经验,但我认为一直缺失的关键因素,是明确认识到这个理想的价值。它需要的不只是资金,更重要的是时间和坚持。”
萨顿说,参访他山科技时,他惊喜地发现这家中国公司理解到了这一点。整个合作计划是五年的周期,目标很明确:找到最适合具身智能的学习方法论。

签约仪式现场
接下来,“机器人幼儿园”会搭建真实环境,让机器人在其中完成训练。虽然初期是以同构本体的形式进行,但马扬相信,在持续学习的探索下,异构机器人在后期不会成为太大的学习障碍。因为一个智能体如果理解了任务的底层逻辑,本体形态不同,也不会阻碍学习和经验的传递。
相比之下,现在更重要的任务是直面真实的环境变量。
马扬直言,具身智能行业的硬件已经达到了60分的水平,真正欠缺的是推理能力和持续学习的能力。少了这两样,就没法做到更好的泛化和演绎,整个行业会被拖进卷参数的泥潭,找不到更广阔的应用空间。
所以,早期学习必须和真实环境不断交互。搭建的训练环境不能再刻意回避真实场景中的各种变量和不利因素,否则机器人学到的经验天花板会很低,很难再往前走了。
他山科技和萨顿的合作,本质上也是为了找到一套新的路径。“在这件事情上,没有什么高科技,只有方法论的选择。”
商业化的前提,是能“边干活边学习”
方法论最终还是要放到应用场景里去检验。马扬对商业化落地有一个很务实的判断:未来三到五年,具身智能最可能率先进入的,不会是那些高逻辑性、高时效要求的场景。
它更适合替代一类特定的工作:人不想干,容错率又不能太低。
这类工作有三个特征:任务重复,但不是完全固定的流水线;对成功率要求极高——失败一次就可能直接中断,需要强人工干预;单次任务的时效要求相对宽松,不需要秒级响应。
马扬举了几个具体的例子。一个是服务业场景,北美餐馆里的洗碗工。工作就是把碗碟冲一下,放进洗碗机,动作很简单,但枯燥繁重。目前美国有几百万人干这个活儿,机器人如果能把这个动作的成功率做到足够高,释放的商业价值相当可观。而且洗碗这个任务时效要求不高,一晚上洗完就行,但对成功率要求很高——打碎一个碗,整个流程就得停下来。
农业加工领域有一个更具体的案例。潜江的小龙虾加工厂里,“小龙虾去头”这道工序一直要靠人工完成。原因很简单,小龙虾大小不一样,壳的软硬度随季节变化,对设备的触觉感知技术要求很高。一个工厂每年在这道工序上的人力成本高达数千万元,高峰时段一两千人在产线上干活。
他山科技花了半年时间,先做模仿学习和仿真训练,再让机器人在真实产线上用强化学习反复自主练习。最终把剥虾成功率提到了95%以上,在高效去除虾头的同时还能完整保留虾黄,提高了产品价值结构。目前,这套智能化剥虾设备已经与头部小龙虾加工企业达成合作,首期签约100台。

他山科技智能化剥虾设备
这些场景的选择逻辑其实很清楚。机器人目前还不能去和人比推理速度,但它很适合去填补那些自动化做不了、人又不愿意干的缺口。而触觉感知,就是解锁这些场景的钥匙。因为它提供实时反馈,机器人可以在执行过程中灵活调整力度和角度,不需要完美预设的轨迹。
如果行业内的大部分精力都放在训练机器人去模仿人,那具身智能的“天花板就是人本身”。想要突破这个天花板,需要整个行业一起探索。
马扬一直强调,比起他山科技自身的壁垒,他更希望看到有更多同行加入进来,一起往正确的方向推动。他山科技和萨顿希望建立一个开放、共享的研发基础设施,吸引全球学术界和产业界共同探索具身智能持续学习的方法论。
现阶段,他山科技和萨顿作为发起方,会先把平台搭起来。而未来,整个体系将逐步面向行业开放,产业链上下游、全球高校、科研机构都可能成为这个合作项目中的生态伙伴。
触觉感知与持续学习的结合,正在为具身智能的下一个十年铺路。
萨顿的答案,已经写在了真实经验流的设想里。而他山科技即将用一座机器人幼儿园,把这个答案变成可执行的工程方案——让具身智能在真实的物理世界中,学会在“错误”中成长。
