游乐游手机版
首页/AI热点日报/热点详情

具身智能基础模型:如何从看懂世界到动手完成任务

类型:热点整理2026-07-24
具身智能基础模型将感知、预测、决策与动作纳入物理闭环,通过多源数据(视频、无本体采集、机器人数据)构建跨本体动作表征,利用统一概率建模实现VLA、世界模型等联合训练,并借助边界状态识别与人类接管持续扩展能力,最终形成从理解世界到稳定执行任务的自主学习闭环。

大语言模型扩展了人类的认知能力,传统机器人延伸了人类的体力边界,而具身智能正试图将二者有机结合:让机器既能理解复杂任务指令,也能在真实物理环境中灵活执行,并基于行动结果持续学习优化。然而,实现这一目标的难度远非简单地为大语言模型加装一条机械臂。语言模型处理的是符号与抽象知识,而机器人面对的是空间关系、接触力学、摩擦系数、遮挡、形变以及不确定性。一个真正可用的具身基础模型,必须将感知、预测、决策与动作整合进同一个物理闭环中。

从这个视角来看,具身智能的核心问题可以凝练为一句话:模型如何将对世界的理解,转化为真实、稳定且具备泛化能力的动作?

本文整理自WAIC 2026智启具身论坛上清华大学计算机系副研究员苏航的演讲《从观察到行动:具身智能的基础模型与反馈学习》,旨在帮助读者理解当前物理AI领域备受关注的具身智能基础模型——它是什么?能做什么?未来将走向何方?

一、身体不是执行器,而是智能与世界之间的接口

如果智能没有身体,它只能在数字世界中观察、分析和生成信息。身体赋予智能另一种学习途径:通过动作影响环境,再从环境反馈中领悟物理规律。

人类并非先掌握完整的物理方程,然后才学会拧螺丝、拉拉链或炒菜。我们在不断的尝试中形成手眼协调、接触判断与动作经验。身体既是行动工具,也是感知与学习系统的一部分。因此,具身智能不是“大脑负责思考,身体只负责执行”的简单组合。它更像一个连续闭环:

感知环境 → 理解任务 → 预测后果 → 生成动作 → 接收反馈 → 更新能力

这条闭环也是具身智能通向更通用智能的重要路径。模型只有真正进入物理世界,才能学习那些无法仅靠语言和图像完整描述的经验。

二、具身智能需要自己的原生基础模型

VLA、世界模型等技术都受益于语言模型和多模态模型的发展,但具身基础模型不能只是现有大模型的简单延伸。原因很直接:大量物理技能很难被语言完整表达。

比如拧紧一颗螺丝时,手需要实时感知阻力;拉拉链时,需要协调方向、张力和速度;炒菜时,需要根据食材状态连续调整动作。这些能力包含大量隐性的时空和接触经验。一个面向真实世界的具身基础模型,至少需要具备三类核心能力:

  • 泛化能力:面对新物体、新环境、新任务甚至新机器人本体,仍能迁移已有经验;
  • 鲁棒性:环境发生扰动、动作出现偏差时,仍能稳定完成任务或恢复;
  • 数据迁移能力:能够联合利用机器人数据、人类操作数据、互联网视频和仿真数据。

这三种能力决定了模型能否从“一个任务训练一个策略”,走向共享物理经验的通用基础模型。

三、具身数据正在从遥操作走向无本体采集

传统机器人数据通常来自遥操作:操作员控制一台具体机器人完成任务,系统记录视觉、关节和动作轨迹。这类数据与目标机器人高度一致,质量较高,但采集成本高,扩展到大量家庭和工业场景非常困难。

UMI类无本体采集提供了另一条路线。采集者可以带着轻量设备进入真实环境,直接记录人类操作过程,不必把整台机器人搬到现场。数据采集因此与特定机器人本体解耦,更容易扩大场景、任务和物体的多样性。但“采回来”不等于“能训练”。

人类数据与机器人数据之间至少存在三类差异:

  1. 观察视角不同:人通常以更高、更灵活的视角观察,机器人的摄像头位置和视野不同;
  2. 身体结构不同:人手、夹爪、机械臂和灵巧手的自由度与运动约束不同;
  3. 动作空间不同:人类可行的动作,并不一定能被机器人直接执行。

所以,无本体数据利用的关键不是简单复制人的轨迹,而是学习一种跨本体的动作表征:从人类动作中提取与具体身体无关的任务意图、空间关系和运动结构,再把它映射到目标机器人的可执行空间。

四、跨本体学习的关键,是建立统一的动作表征

面对不同机器人本体,直接对齐关节角几乎不可行。双臂机器人、单臂机械臂、夹爪和灵巧手拥有不同的自由度,同一个“把杯子放进柜子”的任务,在各自系统中的底层动作完全不同。更可扩展的思路,是把动作映射到一个共享的隐空间。

在这个空间里,模型不直接记忆某台机器人的关节运动,而是学习更抽象的动作单元和物理关系,例如:接近目标、建立抓取、保持约束、沿路径移动、释放物体。

训练时,可以利用离散化或量化机制,把连续且高度异构的动作压缩为可学习的动作表征。不同机器人、人类操作设备和任务数据,因而能够进入同一训练框架。这种统一表征追求的不是让所有本体执行完全相同的轨迹,而是让它们共享相同的任务结构和物理经验。其价值最终体现在零样本迁移上:模型面对未见过的本体、环境、物体或任务结构时,仍能利用过去学到的知识完成操作。

五、视频数据提供规模,机器人数据完成物理对齐

视频是成本最低、来源最广的数据形式之一。互联网和第一视角视频包含大量人类行为、物体变化和场景演化信息,可以帮助模型学习“世界如何变化”。视频生成模型之所以受到具身智能关注,是因为它在预测后续画面的过程中,会学习一部分时序关系和物理先验:物体如何移动、接触后可能发生什么、一个动作如何改变环境状态。

但视频只有观察,没有天然的机器人动作标签。它可以告诉模型“接下来发生了什么”,却不一定能直接告诉机器人“关节应该怎么动”。因此,不同数据承担着不同职责:

  • 互联网视频提供大规模场景、物体和行为知识;
  • 第一视角与UMI数据提供人类操作轨迹和任务结构;
  • 机器人数据提供可执行动作和本体约束;
  • 仿真数据补充可控试错和长尾状态;
  • 真实部署数据提供最终环境中的失败与恢复经验。

具身数据没有一种“万能来源”。真正有效的基础模型,需要把不同数据的优势组合起来。

六、VLA、世界模型、VGM和IDM可以放进统一框架

具身学习中存在多种模型路线:

  • VLA学习从视觉和语言指令到动作的映射;
  • 世界模型预测动作执行后环境会怎样变化;
  • 视频生成模型(VGM)学习视觉世界的时序演化;
  • 逆动力学模型(IDM)根据状态变化反推动作。

这些模型看起来解决不同问题,但本质上都在对条件概率进行建模:给定一部分信息,预测另一部分信息。

例如,VLA根据当前观察和任务指令预测动作;世界模型根据当前状态和动作预测未来;IDM根据当前状态和目标状态推断中间动作。既然它们共享类似的概率建模基础,就有机会在统一架构中联合训练。统一建模带来两项重要收益。

第一,不同来源的数据可以互相增强。没有动作标签的视频也可以帮助模型学习世界变化,机器人数据则负责把这种理解对齐到可执行动作。

第二,多任务后训练不容易破坏模型原有能力。传统VLA在适配新任务时,可能出现灾难性遗忘或能力退化;如果模型拥有更广泛的世界表征和多类型数据基座,新增任务更可能成为能力扩展,而不是对旧能力的覆盖。

七、模型进化最有价值的数据,往往来自能力边界

预训练数据通常由成功演示构成,它告诉模型“正确动作应该是什么”。但机器人进入真实环境后,最有价值的样本往往不是那些已经能稳定完成的任务,而是处在成功与失败边界上的状态。比如机器人准备拿起桌边的水瓶。

正常策略可能直接抓取,但更稳妥的做法是先把水瓶向桌内推,再完成抓取。这样的边界状态很难在标准演示数据中被系统覆盖,却决定了机器人在真实环境中的可靠性。边界数据包括:

  • 动作开始偏离正确轨迹;
  • 抓取不稳但尚未完全失败;
  • 环境发生训练时未见的扰动;
  • 任务可以恢复,但模型不知道如何恢复;
  • 人类必须介入才能继续执行。

这些数据直接暴露了模型当前的能力边界。只要能够把它们收集并转化为训练信号,模型就能有针对性地扩大成功区域。

八、人类接管不是补丁,而是一种高价值训练机制

当机器人偏离正确轨迹时,人类可以短暂接管,把系统从失败边缘拉回成功路径。这个过程通常被称为human-in-the-loop。传统观点容易把人工接管视为自动化不完善的补丁。但从学习角度看,接管数据具有很高价值:它精确发生在模型最需要帮助的位置,包含从错误状态恢复到正确状态的路径。

一个有效的人类接管闭环可以分为四步:1. 系统识别策略偏离或低置信状态;2. 人类在关键时刻接管并纠正动作;3. 系统记录偏离前、接管中和恢复后的完整轨迹;4. 模型利用这些数据学习恢复策略,扩大自主成功范围。

相比继续收集大量重复的成功数据,边界接管数据往往拥有更高的信息密度。它可以减少工程团队为最后10%的长尾问题投入的大量调试时间。更重要的是,人类接管不是永久依赖。每一次接管都应该成为下一轮训练数据,让类似问题在未来逐渐转为自主处理。

九、具身基础模型的完整学习闭环

把上述方法放在一起,可以得到一条从数据到能力的完整路径:

多源数据采集 → 跨本体动作表征 → 统一概率建模 → 多任务预训练 → 真实部署 → 边界状态识别 → 人类接管 → 恢复数据回流 → 模型更新

这里最重要的变化,是训练不再止于模型发布。部署本身成为持续学习的一部分:机器人在真实环境中执行任务,发现预训练没有覆盖的状态,再通过人工接管、失败恢复和数据回流不断扩展能力。因此,具身基础模型的竞争不会只取决于模型参数量,也取决于三个系统能力:

  • 能否低成本获得足够多样的数据;
  • 能否把异构数据映射到统一的物理表征;
  • 能否在真实部署中持续回收边界数据并快速更新模型。

结语:真正的通用能力,来自持续进入未知

具身智能并不是让机器人记住更多标准动作,而是让它能够处理越来越多未见过的物体、环境、本体和异常状态。视频和无本体数据解决规模问题,机器人数据解决动作对齐问题,统一模型解决多任务共享问题,真实部署和人类接管则解决边界扩展问题。

最终,一个成熟的具身基础模型应该形成这样的能力:看得懂环境,理解人的意图,预测行动后果,生成可执行动作,在出现偏差时恢复,并把每一次失败转化为下一次成功的经验。从感知到动作执行,真正连接两端的不是某一个模型模块,而是一套不断与物理世界交互、不断修正自身的数据与学习闭环。

来源:https://www.eefocus.com/article/2057055.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。