
与许多具身智能公司选择自研机器人、打造封闭式模型不同,创始人刘扬关注的是一个更具开放性的愿景:机器人至今尚未像ChatGPT那样拥有统一的模型接口。

在他看来,各类机器人仍需分别适配、分别训练,导致模型能力难以复用。若未来能建立一套跨本体的通用接口,机器人厂商便无需重复训练模型,而是像调用大语言模型API一样调用机器人能力。这正是黎曼动力致力于打造机器人通用API的初衷。

从虚拟游戏世界模型,迈向真实物理世界
2024年下半年,昆仑万维天工团队内部组建了一支世界模型团队。被任命的负责人刘扬,此前主要从事大模型后训练与强化学习。团队希望探索能够进入物理实验的智能体,先从视觉模型入手,尝试构建一个可模拟真实环境、支持模型训练与交互的仿真器。 游戏成为了当时最理想的试验场。 一方面,昆仑万维拥有多年端游开发底蕴,人才与经验储备充足;另一方面,第一人称画面、人物移动及键盘操作是模型易于理解的数据类型,互联网上也能获取大量游戏视频。一个由用户控制、随操作持续生成的虚拟世界,比机械臂在桌面上的移动更直观,也更容易让外界理解世界模型的能力。 团队由此推出Matrix-Game系列,并在2025年持续开源。刘扬表示,当时全球系统地投入世界模型的团队有限,谷歌Genie等代表性项目也未完全开源。由于连续发布模型与技术报告,团队吸引了大量海外研究机构及AI游戏创业公司的关注,“AMI谢赛宁所在的团队也曾使用我们Matrix-Game早期版本进行训练”。 2025年上半年,团队开始将真实场景数据混合训练。众包采集者手持手机在不同环境中移动,模型经过适配后,能生成连续的现实空间,已隐约显现出机器人导航与环境探索的雏形。 真实场景首次证明,世界模型不仅能生成画面,还开始具备理解现实环境的能力。团队顺势重新讨论:这项技术最终应落地于哪个行业? 游戏仍有发展空间,但继续增加非玩家角色、积分与奖励机制,更多是完善游戏功能,天花板相对较低。而若机器人将模型带入真实工作,任务成败将直接验证模型是否理解了物理世界。 “游戏模型好不好,还要让人试玩,其中包含很多主观因素。”他说,“机器人训练好后,你能真实地看到这个模型在变好。” 2025年8月,团队下单购买宇树G1、机械臂及灵巧手,次月陆续到货。他们花了约两个月研究现有技术进展,并尝试将原有模型运行到真机上。 模型团队很快发现,键盘上的前后左右与机械臂的关节控制是两套完全不同的语言。不同型号的机器人拥有不同的动作空间与控制参数,同一模型换到新设备上,通常还需单独训练解码模块。 “我们都有大模型的API,但机器人没有自己的API。”刘扬说。如果一套模型只能控制训练时使用的机器人,它就很难像大语言模型那样成为通用基础设施。黎曼动力希望建立一层跨本体的能力,让不同机器人能调用同一套世界模型,这也是他理解中的“机器人API”。 同年秋天,团队将资源集中到具身智能领域。2026年,黎曼动力从昆仑万维内部独立运营。
机器人需先学会应对“意外”
过去几年,叠衣服、整理桌面和收拾厨房频繁出现在人形机器人的演示视频中。尽管任务本身看似成熟,但场景稍有变化,机器人的表现便可能迅速下降。 实验室会提前逐一摆好衣服,控制摄像头、光线与桌面空间。真实家庭中的衣物通常堆叠在一起,材质、大小和摆放方式每天都在变化。夹爪提起一件衣服时,可能连带夹起下方另一件;机器人找不到空位时,会反复放下、重新抓取,最终陷入循环。 这里有一个关键点:当前机器人主要缺乏两种泛化能力。 第一种发生在任务与场景之间。机器人在一间实验室学会叠衬衫,换一张床、换一种面料,原有策略可能立即失效。 第二种则发生在机器人本体内部。若机械结构、关节数量或动作空间发生变化,模型通常需重新适配。 黎曼动力发布的World Action Model,即世界动作模型,旨在同时解决这两个问题。 常见的机器人VLA模型根据当前画面直接输出动作,而世界动作模型还需学习动作发生后环境可能出现的变化,并在任务执行过程中持续更新状态。机器人由此可观察结果、修改计划,再完成下一步动作。 刘扬以厨房整理为例进行了说明。 机器人需识别盘子、碗和餐具,并判断它们各自应放置的位置。当夹爪拿起叉子准备放入筷子筒时,若角度不合适,它会在筒壁旁借力,调整叉子方向,再尝试插入。 若放碗时不慎将液体洒到桌面,机器人还可能暂停整理,先擦掉水渍。 “它有一个很强的状态概念,知道自己当前完成得怎么样。”刘扬表示。模型需要理解叉子未放入、桌面出现液体等变化,再从已有经验中决定后续动作。 黎曼动力最新披露,Riemann-1.0在同一模型中学习机器人动作及动作引发的环境变化,主要针对长流程任务、跨场景泛化与跨本体迁移等问题。 真实环境仍在不断暴露模型与硬件的边界。夹爪很难从一堆衣服中准确挑出一件,灵巧手则面临重量、耗电与维修成本问题。机器人进入厨房后,刀具、热源与人员安全也会带来新的限制。 面对外界“机器人为何今天还在叠衣服”的质疑,他的回应很直接: “我们要给大家看的,是能在任意场景叠任意一件衣服。” 一次演示可证明技术可行,但只有换到不同家庭依然能完成任务,才能形成可靠的产品交付能力。
具身智能,正等待属于自己的“数据互联网”
世界模型进入机器人本体后,数据成为黎曼动力遇到的另一道门槛。 大语言模型可从互联网获取海量文本,游戏世界模型也能利用公开视频与游戏引擎生成训练素材。机器人则需要第一视角画面、手部运动及完整任务过程,普通视频通常缺少这些信息。 一段做菜视频可能清晰拍到锅里的食物,却未完整记录双手。拍摄角度也会随创作者移动,模型很难据此推断手的位置与动作轨迹。 尽管在工厂采集数据更加标准化,却容易产生大量重复。一个工人连续20小时执行同一种动作,数据规模虽增加,但任务与场景的覆盖范围未能同步扩大。这类数据适合训练单项技能,机械重复并不会产生泛化智能,因此难以支撑通用模型。 “文本模型有Common Crawl,图像有ImageNet,机器人行业积累很少。”他说,“我们全网搜了一遍,能找到的可用数据可能只有几万小时,离真正的Scaling还很远。” 黎曼动力后来将注意力转向人类第一视角视频,即拍摄者自己完成任务时看到的画面。采集者无需佩戴动作捕捉手套,只要用手机记录日常工作,并确保双手出现在画面中。 这类数据最初并不被行业重视。刘扬回忆,合作方接到需求时,一度怀疑任务的真实性,因为其他客户通常需要带有精确关节信息的手套数据或真机轨迹。 训练结果改变了对方的判断:来自不同家庭的视频覆盖了不同房间、桌面和物品摆放方式,模型由此接触到更丰富的环境。机器人拿杯子和整理衣物时,动作轨迹也逐渐接近人类的自然操作。 “以前机器人拿杯子,会先到一个固定坐标,再从一个很奇怪的角度慢慢靠近。用了人类数据后,它会像人一样,直接从自然的角度去拿。” 据黎曼动力披露,Riemann-1.0使用的23.2万小时多源具身交互数据,包括超过20万小时人类第一视角视频、1.2万小时高精度示教数据,以及2万小时真机与仿真轨迹,覆盖41种机器人本体。
接下来,团队计划将第一视角数据扩展到100万小时,目前主要采用众包采集,因为分散在不同地点的参与者能覆盖更多家庭与任务。 众包的天花板也已显现:拍摄质量高、参与意愿强的用户只占少数,同一采集者周边的可记录场景会逐渐耗尽。有人拍完自己家,又去朋友家、邻居家甚至小区里寻找新环境,数据覆盖继续扩大时,采集与筛选成本都会上升。 在他看来,具身智能可能需要建立新的数据经济。数据不仅决定模型能力,也决定未来API能覆盖多少场景。机器人进入真实世界的次数越多,模型可调用的能力也会持续增加。 当下,一些清洁、家政和养老服务机构尝试在完成工作的同时采集授权数据,真实场景由此持续进入模型训练。机器人每次部署,也会成为下一轮能力提升的起点。 这条路径要求黎曼动力同时补齐模型、本体与真实场景。他透露,公司当前的实验主要使用外购机器人,自研本体仍在推进,团队也在招聘灵巧手和硬件方向的人才。 独立运营后,团队开始同时考虑技术、融资与商业计划。“以前做完2.0,我们讨论3.0怎么做。现在要把六个月、一年、三年、五年之后的商业计划都打通。”

