游乐游手机版
首页/AI热点日报/热点详情

清华李升波:物理原生智能与因果约束具身新范式

类型:热点整理2026-07-20
具身智能迈向通用化面临物理世界交互难题。清华大学李升波提出物理原生智能概念,强调状态解耦、因果时序与物理规律嵌入。通过物理原生世界模型、数据三要素及嵌入安全与抗遗忘的训练算法,为自动驾驶与机器人通用化提供可行路径。

人工智能的终极目标,归根结底,是实现通用智能。在视觉、语言、多模态智能相继取得重大进展后,能够与真实物理世界直接交互的具身智能,正成为通往通用智能的关键领域。然而,开发通用化的具身智能体所面临的挑战,远大于处理图像或文本。2026年7月18日,在WAIC 2026高级别自动驾驶创新发展论坛上,清华大学车辆与运载学院、人工智能学院教授李升波发表了题为《迈向泛在具身智能之路:物理原生的世界模型、数据结构与训练算法》的演讲,并首次提出了“物理原生智能”(Physics-native Intelligence, Phi)这一概念。

李升波教授在采访中详细阐述了他的技术体系,为破解具身智能的核心难题开辟了一条全新路径。

当前,视觉、语言、多模态大模型已在人工智能赛道实现规模化落地,但智能体一旦进入真实物理世界,其能力短板便显露无疑。李升波教授指出,具身智能的最终目标是通用化,而自动驾驶作为首个量产化的具身智能系统,其智能水平至今仍远未达到人类水准,目前功能仅停留在L2级驾驶辅助,距离L4级仍有相当距离。相比之下,机器人自由度更高、场景结构更复杂、交互对象更丰富,训练难度至少是汽车的十倍以上。具体数据上,汽车需要百亿级网络参数和亿级驾驶片段,而机器人则需要万亿级参数和千亿级交互片段。这意味着,沿用现有视觉、语言和多模态大模型的训练思路,根本无法奏效。

在梳理理论根基时,李升波提出了“物理原生智能”的概念。简单来说,物理原生智能是一类更依赖物理规律、以与物理世界更好交互为目标的具身智能。它依然以数据驱动的端到端模型训练为基本架构,但必须从世界模型、数据结构和训练算法三个维度,更深入地考虑物理实体对智能的客观要求——包括物理世界的数据稀缺性、极高的功能安全性要求,以及模型训练必须追求的稳定性和长期性。

物理原生智能具备三项核心特征。第一,状态表征必须解耦。这意味着系统状态由“显状态”和“隐状态”两部分构成。显状态服从系统动力学与物理约束,确保状态转移长期稳定;隐状态则受物理规律驱动的受控转移,保证长期推演不漂移。第二,模型结构必须满足时序性和因果性。具体而言,要严格遵循时序优先,原因先于结果,状态预测不能依赖未来信息;要具备干预敏感,改变动作输入后,后续状态应产生可解释的差异;同时还要关注反事实,不仅从正样本中学习,也要从负样本中获取信息收益。第三,训练过程必须嵌入底层物理规律。要求对称守恒,由对称性决定的物理量应守恒或受控变化;要求结构保持,训练动力学应维护其几何结构和能量收支规律。

基于这些特征,李升波详细阐述了物理原生智能的具体开发方法。他认为,世界模型是物理原生智能的核心。从朴素世界模型、世界动作模型到受控世界模型,面向具身智能的一个核心问题就是:如何增加动作输入,让模型真正能够影响物理世界。世界动作模型的思路是增加逆动力学模型,通过未来的状态与动作进行关联;受控世界模型的思路则是直接增加一个动作维度。但问题在于,这两类方法在长程化、精细化、高稳定的动作输出上并不理想,而且与强化学习等类脑训练算法的匹配度也不高。

物理原生世界模型的设计则更强调因果规律的满足,以显式和隐式状态为转移动力学核心。显式状态直接嵌入物理动力学模型,隐式状态则采用神经网络构造物理模型。观测到状态的映射沿用现有编码器机制,以便利用大模型领域的成果。而策略模块和评价模块直接与状态关联,而非观测,这种结构化的信息输入被认为将有效提升动作的准确性、功能安全性与可解释性。

在数据层面,李升波提出了物理原生数据的三要素:从当前观测到下一观测的转移数据、奖励信号r,以及人类的经验知识K。互联网视频数据、Ego/UMI数据、真机操作数据、仿真合成数据,都可以通过一定的数据重构、时空对齐和质量增强,转化为结构一致的物理原生数据。这三类数据各有用途:转移数据支撑编码器、解码器和受控转移模块的训练,并提供部分策略性能;奖励信号则以强化学习为主,驱动评价模块并进一步提升策略;人类经验知识则通过大模型的评价能力,注入受控转移模型或评价模型,为世界模型的性能提升提供支持。

训练算法的设计是物理原生智能落地的关键保障。第一,嵌入训练动力学的底层规律,尤其是结构对称守恒特性。神经网络训练过程本质上是一个动力学系统的离散状态演化过程。类似于物理世界的动力学,训练动力学也存在广义能量守恒、辛几何结构保持等底层规律,将这些性质强制嵌入训练算法设计,可以极大提升训练的稳定性。

第二,具备绝对安全保障能力,这是具身智能模型训练的特殊要求。绝对安全意味着在真机训练过程中,每一代模型都必须满足安全硬约束,就像人类新手学车,学习过程本身也必须安全。实现原理在于同步训练每一代的最优策略及其运行的可行区域,而可行区域的扩大与智能体对环境的认知不确定性相互制约,需要通过博弈机制达到均衡状态。

第三,具备抗遗忘能力。由于具身智能数据稀少、应用场景繁多且性能要求高,训练过程只能多阶段分步骤实施,采用监督学习预训练、强化学习后训练、再使用强化学习真机微调的阶梯范式,通过构建抗遗忘条件与梯度正交机制,确保后续训练不会覆盖先前性能,从而实现能力的持续进化。

李升波认为,从自动驾驶到机器人,未来或将迈入可与一切物理实体交互的泛在物理世界。物理原生智能,正是通往这一泛在具身智能之路的基石。通过将物理规律、因果逻辑与安全机制深度嵌入数据驱动的端到端学习全流程,这套体系为攻克具身智能的通用化难题提供了可行的技术路径。

来源:https://finance.sina.com.cn/roll/2026-07-20/doc-iniimqsk8142827.shtml

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。