游乐游手机版
首页/科技数码/文章详情

世界模型走出屏幕,家具身初创构建机器人通用API

时间:2026-07-22 12:10
黎曼动力发布世界动作模型Riemann-1 0,旨在建立跨本体的机器人通用API。该模型利用23 2万小时多源数据训练,涵盖人类第一视角视频,使机器人能处理长流程任务并泛化至不同场景与本体,目标直指家庭服务并推动机器人API市场形成。
2025年秋季,一场别开生面的实验在昆仑万维北京办公区悄然启动。一台宇树G1机器人被搬至七楼,旁边是一支由数十人组成的模型团队。他们试图验证一个关键问题:此前在游戏中持续生成画面的世界模型,能否驱动这台机器人完成真实世界的任务? 双足机器人穿梭于工位间,沉重的脚步声穿透楼层,即便戴着耳机,同事也难以屏蔽,投诉随之而来。团队只得另租实验室,将机器人搬迁过去继续训练。数月后,这群原本专注于视频生成、游戏引擎及大模型后训练的研究者,决定将核心资源转向机器人领域。 今年的世界人工智能大会(WAIC)上,这支团队以“黎曼动力”的身份首次公开亮相,并发布了世界动作模型——Riemann-1.0。

与许多具身智能公司选择自研机器人、打造封闭式模型不同,创始人刘扬关注的是一个更具开放性的愿景:机器人至今尚未像ChatGPT那样拥有统一的模型接口。

在他看来,各类机器人仍需分别适配、分别训练,导致模型能力难以复用。若未来能建立一套跨本体的通用接口,机器人厂商便无需重复训练模型,而是像调用大语言模型API一样调用机器人能力。这正是黎曼动力致力于打造机器人通用API的初衷。

从虚拟游戏世界模型,迈向真实物理世界

2024年下半年,昆仑万维天工团队内部组建了一支世界模型团队。被任命的负责人刘扬,此前主要从事大模型后训练与强化学习。团队希望探索能够进入物理实验的智能体,先从视觉模型入手,尝试构建一个可模拟真实环境、支持模型训练与交互的仿真器。 游戏成为了当时最理想的试验场。 一方面,昆仑万维拥有多年端游开发底蕴,人才与经验储备充足;另一方面,第一人称画面、人物移动及键盘操作是模型易于理解的数据类型,互联网上也能获取大量游戏视频。一个由用户控制、随操作持续生成的虚拟世界,比机械臂在桌面上的移动更直观,也更容易让外界理解世界模型的能力。 团队由此推出Matrix-Game系列,并在2025年持续开源。刘扬表示,当时全球系统地投入世界模型的团队有限,谷歌Genie等代表性项目也未完全开源。由于连续发布模型与技术报告,团队吸引了大量海外研究机构及AI游戏创业公司的关注,“AMI谢赛宁所在的团队也曾使用我们Matrix-Game早期版本进行训练”。 2025年上半年,团队开始将真实场景数据混合训练。众包采集者手持手机在不同环境中移动,模型经过适配后,能生成连续的现实空间,已隐约显现出机器人导航与环境探索的雏形。 真实场景首次证明,世界模型不仅能生成画面,还开始具备理解现实环境的能力。团队顺势重新讨论:这项技术最终应落地于哪个行业? 游戏仍有发展空间,但继续增加非玩家角色、积分与奖励机制,更多是完善游戏功能,天花板相对较低。而若机器人将模型带入真实工作,任务成败将直接验证模型是否理解了物理世界。 “游戏模型好不好,还要让人试玩,其中包含很多主观因素。”他说,“机器人训练好后,你能真实地看到这个模型在变好。” 2025年8月,团队下单购买宇树G1、机械臂及灵巧手,次月陆续到货。他们花了约两个月研究现有技术进展,并尝试将原有模型运行到真机上。 模型团队很快发现,键盘上的前后左右与机械臂的关节控制是两套完全不同的语言。不同型号的机器人拥有不同的动作空间与控制参数,同一模型换到新设备上,通常还需单独训练解码模块。 “我们都有大模型的API,但机器人没有自己的API。”刘扬说。如果一套模型只能控制训练时使用的机器人,它就很难像大语言模型那样成为通用基础设施。黎曼动力希望建立一层跨本体的能力,让不同机器人能调用同一套世界模型,这也是他理解中的“机器人API”。 同年秋天,团队将资源集中到具身智能领域。2026年,黎曼动力从昆仑万维内部独立运营。

机器人需先学会应对“意外”

过去几年,叠衣服、整理桌面和收拾厨房频繁出现在人形机器人的演示视频中。尽管任务本身看似成熟,但场景稍有变化,机器人的表现便可能迅速下降。 实验室会提前逐一摆好衣服,控制摄像头、光线与桌面空间。真实家庭中的衣物通常堆叠在一起,材质、大小和摆放方式每天都在变化。夹爪提起一件衣服时,可能连带夹起下方另一件;机器人找不到空位时,会反复放下、重新抓取,最终陷入循环。 这里有一个关键点:当前机器人主要缺乏两种泛化能力。 第一种发生在任务与场景之间。机器人在一间实验室学会叠衬衫,换一张床、换一种面料,原有策略可能立即失效。 第二种则发生在机器人本体内部。若机械结构、关节数量或动作空间发生变化,模型通常需重新适配。 黎曼动力发布的World Action Model,即世界动作模型,旨在同时解决这两个问题。 常见的机器人VLA模型根据当前画面直接输出动作,而世界动作模型还需学习动作发生后环境可能出现的变化,并在任务执行过程中持续更新状态。机器人由此可观察结果、修改计划,再完成下一步动作。 刘扬以厨房整理为例进行了说明。 机器人需识别盘子、碗和餐具,并判断它们各自应放置的位置。当夹爪拿起叉子准备放入筷子筒时,若角度不合适,它会在筒壁旁借力,调整叉子方向,再尝试插入。 若放碗时不慎将液体洒到桌面,机器人还可能暂停整理,先擦掉水渍。 “它有一个很强的状态概念,知道自己当前完成得怎么样。”刘扬表示。模型需要理解叉子未放入、桌面出现液体等变化,再从已有经验中决定后续动作。 黎曼动力最新披露,Riemann-1.0在同一模型中学习机器人动作及动作引发的环境变化,主要针对长流程任务、跨场景泛化与跨本体迁移等问题。 真实环境仍在不断暴露模型与硬件的边界。夹爪很难从一堆衣服中准确挑出一件,灵巧手则面临重量、耗电与维修成本问题。机器人进入厨房后,刀具、热源与人员安全也会带来新的限制。 面对外界“机器人为何今天还在叠衣服”的质疑,他的回应很直接: “我们要给大家看的,是能在任意场景叠任意一件衣服。” 一次演示可证明技术可行,但只有换到不同家庭依然能完成任务,才能形成可靠的产品交付能力。

具身智能,正等待属于自己的“数据互联网”

世界模型进入机器人本体后,数据成为黎曼动力遇到的另一道门槛。 大语言模型可从互联网获取海量文本,游戏世界模型也能利用公开视频与游戏引擎生成训练素材。机器人则需要第一视角画面、手部运动及完整任务过程,普通视频通常缺少这些信息。 一段做菜视频可能清晰拍到锅里的食物,却未完整记录双手。拍摄角度也会随创作者移动,模型很难据此推断手的位置与动作轨迹。 尽管在工厂采集数据更加标准化,却容易产生大量重复。一个工人连续20小时执行同一种动作,数据规模虽增加,但任务与场景的覆盖范围未能同步扩大。这类数据适合训练单项技能,机械重复并不会产生泛化智能,因此难以支撑通用模型。 “文本模型有Common Crawl,图像有ImageNet,机器人行业积累很少。”他说,“我们全网搜了一遍,能找到的可用数据可能只有几万小时,离真正的Scaling还很远。” 黎曼动力后来将注意力转向人类第一视角视频,即拍摄者自己完成任务时看到的画面。采集者无需佩戴动作捕捉手套,只要用手机记录日常工作,并确保双手出现在画面中。 这类数据最初并不被行业重视。刘扬回忆,合作方接到需求时,一度怀疑任务的真实性,因为其他客户通常需要带有精确关节信息的手套数据或真机轨迹。 训练结果改变了对方的判断:来自不同家庭的视频覆盖了不同房间、桌面和物品摆放方式,模型由此接触到更丰富的环境。机器人拿杯子和整理衣物时,动作轨迹也逐渐接近人类的自然操作。 “以前机器人拿杯子,会先到一个固定坐标,再从一个很奇怪的角度慢慢靠近。用了人类数据后,它会像人一样,直接从自然的角度去拿。” 据黎曼动力披露,Riemann-1.0使用的23.2万小时多源具身交互数据,包括超过20万小时人类第一视角视频、1.2万小时高精度示教数据,以及2万小时真机与仿真轨迹,覆盖41种机器人本体。

接下来,团队计划将第一视角数据扩展到100万小时,目前主要采用众包采集,因为分散在不同地点的参与者能覆盖更多家庭与任务。 众包的天花板也已显现:拍摄质量高、参与意愿强的用户只占少数,同一采集者周边的可记录场景会逐渐耗尽。有人拍完自己家,又去朋友家、邻居家甚至小区里寻找新环境,数据覆盖继续扩大时,采集与筛选成本都会上升。 在他看来,具身智能可能需要建立新的数据经济。数据不仅决定模型能力,也决定未来API能覆盖多少场景。机器人进入真实世界的次数越多,模型可调用的能力也会持续增加。 当下,一些清洁、家政和养老服务机构尝试在完成工作的同时采集授权数据,真实场景由此持续进入模型训练。机器人每次部署,也会成为下一轮能力提升的起点。 这条路径要求黎曼动力同时补齐模型、本体与真实场景。他透露,公司当前的实验主要使用外购机器人,自研本体仍在推进,团队也在招聘灵巧手和硬件方向的人才。 独立运营后,团队开始同时考虑技术、融资与商业计划。“以前做完2.0,我们讨论3.0怎么做。现在要把六个月、一年、三年、五年之后的商业计划都打通。”

通往家庭的首个落地场景

对黎曼动力而言,家庭是世界模型最希望进入的场景,也是未来API最容易形成规模化调用的地方。 不过在此之前,团队内部曾认真研究过同行花大价钱热捧的工厂流水线。 团队走访了浙江的一些零部件加工企业,逐渐感受到:拧螺丝、拆包装、打磨和搬运等任务重复度高,对精度与稳定性要求严格,企业的需求更多集中在机械结构、末端执行器和运动控制。 “很多工厂甚至说,他们不需要特别强的大脑。”标准化工位可通过硬件与流程设计降低任务复杂度,这与黎曼动力擅长的通用模型并不完全重合。 家庭、酒店和养老机构则充满长尾问题。物品摆放随时变化,人与机器人共享空间,任务也很难提前穷举。这些环境对模型的“大脑”能力提出更高要求,也成为黎曼动力选择消费端服务场景的原因。 日本是团队目前最先接触到明确付费需求的海外市场。 2025年秋天,昆仑万维战略团队与潜在投资方曾前往日本调研。当地酒店、养老院、机场和商超愿意尝试整理、清洁及辅助照护类机器人,老龄化与较高的机器人接受度也为试点提供了条件。 现阶段,黎曼动力沿两条路线推进商业化。 在国内,团队希望将模型以API形式提供给机器人本体厂商,让缺少大模型研发能力的团队能快速接入;日本商务团队则正在接触酒店、养老院、机场和商超等场景。 刘扬认为,通用模型可能改变机器人的商业模式。本体厂商目前主要依靠出售硬件获得收入,一套能够适配不同设备的API出现后,厂商可以围绕清洁、整理和照护任务持续出售服务。 对于行业演进的方向,他的判断更为激进。 “我觉得机器人未来两年,可能会出现一个完全不一样的Token经济时代。”他说。届时,一些机器人公司能像今天的AI应用创业者一样,调用基础模型,再围绕具体场景开发产品。 他预计,到2027年末或2028年初,世界模型可能接近大语言模型当年的“GPT-3时刻”。 “到了那个时刻,很多技术路线会收敛,也会有一部分玩家被淘汰。它最大的赋能可能就是机器人的API市场,让大量机器人厂商从卖机器人走向卖服务。”
来源:https://www.163.com/dy/article/L2CNGGP505119C3G.html
上一篇新能源汽车可靠性测试门槛提至3万公里 车企研发体系承压 下一篇realme宣布暂缓国内业务聚焦海外承诺保障售后服务
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
罗福莉入选新一届35岁以下科技创新35人中国区名单
科技数码 · 2026-07-25

罗福莉入选新一届35岁以下科技创新35人中国区名单

2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。

美国科技巨头为AI投资年内裁员近14万人
科技数码 · 2026-07-25

美国科技巨头为AI投资年内裁员近14万人

美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。

位AI Infra高管复盘WAIC:暴力美学触顶后求变?
科技数码 · 2026-07-25

位AI Infra高管复盘WAIC:暴力美学触顶后求变?

WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。

显卡厂商封仓引发涨价 玩家面临高价购买
科技数码 · 2026-07-25

显卡厂商封仓引发涨价 玩家面临高价购买

显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542

OpenAI加入签署AI开源模型公开信,组织达35家
科技数码 · 2026-07-25

OpenAI加入签署AI开源模型公开信,组织达35家

7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。