编辑|+0
今年的 WRC,比往年显得更加热闹。
从展馆内高频出现的人形机器人,到各家持续刷新的模型能力、操作表现与运动控制水平,几乎每走几步,都能看到新的机器人形态和能力演示。具身智能、人形机器人与机器人大模型的热度,几乎覆盖了整个展馆。
8 月 19 日,在银河通用举办的「具身智能大模型的进化之路:从技术分级到产业落地」论坛现场,一台此前从未公开亮相的双足人形机器人率先走上台前。
这正是银河通用首次发布的人形双足机器人 Galbot ET1。登场后,ET1 先完成了一段节奏感鲜明的舞蹈表演,转身、摆臂、身体律动衔接流畅,随后又与曾登上春晚、展示盘核桃能力的机器人「小盖」同台互动。

视频链接:https://mp.weixin.qq.com/s/-YHT1QBocPGeCkl4bA3GKw
到了 2026 年,机器人会跳舞已经不算新鲜事。过去两年,它们学会了翻跟头、拳击、踢足球、做家务,一些动作甚至比人类完成得更熟练。
但真正走进现实场景,核心难点并不只是「做出一个动作」,而是在物体移动、目标被遮挡、任务中途被打断等情况下,机器人还能否及时调整,并持续把任务完成。
从 VLA、世界模型到 WAM,模型范式虽然不断演进,但最终要解决的仍是同一个关键问题:机器人能否在动态环境中持续、稳定、自主地执行任务。
这也成为此次论坛,以及银河通用 C104 展台展示内容中的一条主线。
先从刚刚亮相的 ET1 说起。
新双足亮相,重点不只是两条腿
刚刚登场的 ET1,首先引出了一个重要问题:当机器人的身体形态发生变化,原有的智能能力究竟还能保留多少?
ET1 与此前已经公开的 G1、S1,在本体结构和形态上差异明显。但几类机器人背后共享着一条共同的技术主线——都围绕银河通用自研的全身全手端到端具身大模型 AstraBrain 展开。
所谓跨本体,就是让已经获得的智能能力尽可能迁移到不同机器人平台上,而不是每更换一种硬件形态,就需要从零开始重新训练。
银河通用创始人兼 CTO、北京大学研究员王鹤在讲解技术框架时提到,人形机器人的「通用」并不只是把同一颗大脑迁移到不同身体上。更完整的结构是「大脑—脑桥—小脑」:高层的大脑负责感知、认知和行动决策,小脑负责把人或大脑给出的意图转化成连续、稳定的全身运动,中间再通过「脑桥」将两者连接起来。
ET1 上首先落地的是 AstraBrain-WBC,即银河星脑的「通用小脑」。王鹤介绍,之前展示的 AstraBrain-WBC 0.5 已经具备向训练中未见动作泛化的能力,而 ET1 使用的是进一步迭代后的 AstraBrain-WBC 1.0。它主要解决的问题是,在接收到新的运动意图后,如何将其稳定映射为机器人的全身动作。

ET1 搭载了银河通用全自研的 AstraBrain-Agent,主要承担其中的「理解与决策」。这套面向人形机器人实时多模态交互与运动控制的智能体,需要让机器人持续观察周围环境、理解自然语言,并根据当前环境和任务指令动态规划自己的行为与动作。
王鹤将 ET1 的能力概括为三个词:I See.I Learn.I Act。也就是说,机器人能够在真实场景中调用移动能力、多模态交互能力和语言交互能力,并围绕任务生成行动方案。

另外,这位「新同事」还展示了一项颇具代表性的技能:实时学习人的新动作。
现场演示中,ET1 可以自主识别并提取人类的实时运动轨迹,再将这些轨迹转化为自己的全身动作。像手撑地等高难度街舞动作,也能够在运控模型与实时学习能力的配合下完成。

这对应着人形机器人进入开放环境后无法回避的问题:不可能事先把所有运动技能逐一写进模型,那么机器人能不能从观察到的人类行为中继续获得新的运动能力?
如果说高层模型负责判断机器人「接下来做什么」,那么小脑解决的则是「身体具体怎么动」。王鹤将其称为「小脑范式」:接收来自人或机器人大脑的运动意图,并将其转化为实时的全身动作。
在 AstraBrain-WBC 展示中,人类通过动捕设备连续输入全身运动,用于测试模型的实时跟踪、动作精度、稳定性与泛化能力。AstraBrain-WBC 0.5 已经开始向训练中未见过的动作实现泛化。
王鹤还提到,AstraBrain-WBC 的训练使用了大规模人类动作数据。团队观察到,随着数据规模持续扩大,关节追踪误差不断下降。也就是说,全身运动控制同样沿着基础模型的 Scaling 路径持续提升。
无论是大脑还是小脑,模型能力的提升都离不开数据支撑。
王鹤在演讲中介绍了银河通用的五层数据体系 AstraData(银河星数),包括互联网数据、人类动作数据、合成仿真数据、真机遥操数据和真机回流数据。

不同类型的数据承担着不同作用:互联网和人类视频提供语义与操作先验;合成仿真数据用于放大训练规模;真机遥操数据提供真实机器人上的高精度轨迹;部署后的真机数据则继续回流,用于后续训练与模型迭代。
针对 ET1 的运动控制训练,王鹤提到,其训练数据中包含高精度动捕数据,以及从互联网人类视频中重定向得到的动作数据。
当任务从动作复现进一步进入高速、持续变化的环境后,难度还会继续上升。ET1 也正在学习网球这类复杂运动技能。
与搬箱子、拿商品不同,网球几乎不给机器人留下充裕的计算时间。球的位置、速度与落点持续变化,机器人既要判断轨迹,也要协调全身动作,并控制挥拍时机。这要求感知、决策和运动控制在极短时间内连续完成。

王鹤将网球视为人形机器人「AlphaGo 时刻」的代表任务之一。其关注点不仅在于运动控制,还包括实时决策,以及仿真中学到的能力能否通过 Sim-to-Real 迁移到真实机器人上。
王鹤还在现场预告,8 月 22 日晚 7 点半,银河通用的人形机器人将在世界人形机器人运动会开幕式进行人机混双表演,并与网球界嘉宾互动,届时将进行直播,值得期待。
同一颗星脑,在不同现场干活
来到 C104 展台,模型能力、泛化能力与产业落地,很快就变成了一件件具体可见的事。
G1 在家庭和零售场景中工作,S1 负责重载搬运,另一边还有迎宾与二次开发展示。几台机器人形态不同,面对的任务类型也不相同。
王鹤在演讲中介绍,跨场景、跨本体和多任务能力,主要对应 AstraBrain-WAM0.5。
WAM,即世界动作模型。按照王鹤的解释,VLA 的训练依赖 Action Label;世界模型可以预测未来状态,但并不直接给出机器人的动作。WAM 则尝试将未来状态建模与动作生成结合起来。
AstraBrain WAM0.5 在隐空间中对未来进行建模,而不是直接生成完整的未来 RGB 图像,以减少光照、纹理等与操作关系较弱的信息干扰。
这套模型已经被用于不同场景、不同机器人本体和多种任务中,包括商超上下货、叠衣服和搬箱等。
先看家庭场景。
G1 需要完成物品归置、洗衣晾衣、床上叠衣等连续操作。面对积木、钥匙串、玩偶、水果等不同物体,它需要根据物理属性调整抓取方式;到了衣物、床品等柔性物体面前,又要找到衣领、袖口和下摆,完成展开、对齐与折叠。
不同刚性和柔性物体的状态会随着操作持续变化,因此机器人需要不断更新感知结果,并据此调整抓取策略和后续动作。

另一项早餐制作任务,则把长程任务执行与抗干扰能力放进了同一个场景。
G1 需要连续完成烤面包、倒饮料等操作;过程中,如果有人移动面包、拿走杯子、遮挡目标,或者改变盘子等物体的位置,机器人需要重新识别当前状态、调整后续动作,并继续把任务完成。
王鹤介绍,这类能力来自 WAM 基模与真机强化学习的结合,并进一步向 10 分钟级连续早餐任务扩展,包括切水果、做三明治、烤面包和倒水等多个步骤。

到了零售区,变量从家庭中的动态物体,变成了更复杂的货架环境和商品布局。
面对密集排布的商品,G1 需要完成识别、取物、配送和交付。面对商品位置变化与遮挡,G1 必须实时识别目标并调整取物策略,而不是依赖固定的货架布局。

零售应用也已经不只是展台中的演示项目。
银河通用的智慧药房解决方案已经进入多个城市的即时零售仓,「银河太空舱」也已在多个城市完成部署。相比一次性的 Demo,长期、重复运行的真实场景提出了更直接的要求:模型不仅要把任务做出来,还要能够持续稳定地工作。
工业区则换了一套完全不同的要求。
S1 现场完成的是公斤级物料拆垛、搬运与码垛。到了工厂,问题不只是「能不能拿起来」,还包括能否稳定搬运重物、准确放置、长期保持效率与精度,以及在物料状态变化后是否需要重新调试。

相比高度标准化的传统自动化场景,具身智能更多需要面对的是物料位置变化、任务切换以及现场条件变化等现实问题。
目前,S1 已经在宁德时代产线进入 7×24 小时常态化运行。
从展台演示走到产线持续作业,跨越的正是「模型能力」与「产业能力」之间的距离。
把几个场景放在一起看,长程任务、多任务处理、柔性操作与抗干扰能力,对应的都是实际运行中的具体要求:任务能否持续完成,环境变化后能否自主调整,以及是否需要人工频繁介入。
这些自主任务展示的重点,正是机器人如何根据实时环境状态完成感知、决策与执行闭环。
到了二次开发区,问题进一步转向这些能力能否被更多开发者和产业伙伴使用。现场,北汽鹏龙行基于 Galbot 平台开发的 4S 店迎宾、导购等应用也进行了展示。
对银河通用来说,模型能否跨任务是一方面,开发与部署能力能否被产业伙伴继续使用,同样关系到通用能力能否规模化复制。英伟达、宁德时代等科技与产业伙伴也已经参与到这套开发生态中。
具身智能,需要一套新的「能力标尺」
从 ET1 到 C104 展台,机器人展现出的能力越来越多:跨本体迁移、实时交互、全身运动,以及在动态环境中持续完成任务的能力。
但当能力不断增多之后,一个更基础的问题也随之出现:我们究竟该如何判断一台机器人「智能到了什么程度」?
这也是银河通用此次 WRC 论坛「具身智能大模型的进化之路:从技术分级到产业落地」试图讨论的核心问题之一。
今年谈具身智能,VLA、世界模型、WAM 已经不是陌生词。比起再次解释这些概念,相信大家更关心的是另一个问题:它们究竟把机器人的能力扩展了多少,又距离真正进入产业应用还有多远?
银河通用这场论坛中,讨论重点也落在两个方向上:具身智能的技术能力接下来该如何分级、如何继续演进;以及这些能力要到什么时候,才足以支撑真实的产业场景落地。
论坛的五场主旨演讲,从不同角度回应了这些关键问题。

来自机器人学、人工智能、认知机器人以及产业研究领域的学者,分别从多模态与端到端机器人学习、世界模型与机器人数据、技术成熟度与产业化、类脑与认知机器人、通用世界模型等方向展开讨论。不同演讲采用的技术视角与研究路径并不完全相同,这也反映出当前具身智能仍处在多种技术路线并行探索的阶段。
也正因如此,如何评价能力进展,开始成为一个基础而关键的问题。
论坛现场发布的《全球具身智能大模型研究报告》,对全球具身智能大模型的主要技术路线和模型演进进行了系统梳理,并提出了具身大模型评价体系框架。该框架从数据基建、端到端能力、通用能力和部署能力四个层面展开,还进一步提出了 L1 - L5 分级,以此衡量模型从单项能力到多场景、多任务、持续学习和自主闭环的发展水平。
另一项发布成果——财新数据「具身智能长期价值指数」,则进一步把观察维度延伸到产业端,从智能边界、数据基座、模型架构等维度考察企业,关注技术能力如何进一步转化为长期产业价值。
论坛最后的圆桌讨论,再次回到「进化路径与技术挑战」:从 VLA 到世界动作模型,模型如何进一步进入物理世界?实验室中的进展距离真实场景究竟还有多远?从技术分级到产业落地,中间还缺少哪些关键环节?

更重要的是,它能否完成更长的任务链,应对持续变化的环境,迁移到不同机器人本体,并在这些条件下依然保持足够稳定的表现。
模型名称和技术范式还会持续变化,但从技术研发走向产业应用,仍然需要一套相对清晰的能力评价体系,用来判断技术所处的位置,以及下一步需要优先解决的问题。
结语
AI 行业有一个非常明显的特点:很多东西还没来得及成为常识,下一轮变化就已经开始。具身智能领域尤其如此。
过去几年里,新的模型架构、训练方法和技术名词不断出现。端到端、Agent、VLA、世界模型……几乎每隔一段时间,行业讨论的关键词都会更新。机器人的形态也没有最终定论,轮式、双足、四足,甚至是否一定要做人形,行业内都存在不同答案。
但从这次论坛和展台展示来看,一个相对明确的方向正在形成:模型能力正从单项任务走向跨任务、跨本体和动态环境中的持续执行。与此同时,如何降低场景适配成本与部署成本,也开始成为与模型能力同样重要的问题。
当这些能力能够在不同机器人和不同场景之间实现稳定复用,具身智能才有可能从技术展示进一步迈向规模化应用。
到那时,一个长期困扰具身智能行业的问题,也可能真正开始有答案:今天投入的大量研发,究竟何时才能变成可规模化复制、真正算得过账的生产力?
