首页 游戏 软件 资讯 排行榜 专题
首页
AI资讯
Meta首席科学家LeCun发文:详述JEPA物理规划的全面指南

Meta首席科学家LeCun发文:详述JEPA物理规划的全面指南

热心网友
68
转载
2026-01-04



编辑|Panda

长期以来,AI 领域一直怀揣着一个宏大的梦想:创造出能够像人类一样直观理解物理世界,并在从未见过的任务和环境中游刃有余的智能体。

传统的强化学习方法往往比较笨拙,需要通过无数次的试错和海量的样本才能学到一点皮毛,这在奖励信号稀疏的现实环境中简直是灾难。

为了打破这一僵局,研究者们提出了「世界模型」这一概念,即让智能体在脑海中构建一个物理模拟器,通过预测未来状态来进行演练。

近年来,虽然能够生成精美像素画面的生成式模型层出不穷,但对于物理规划而言,沉溺于无关紧要的细节(如背景烟雾的流动)往往是低效的。真正的挑战在于,如何在错综复杂的原始视觉输入中提取抽象精髓。

这便引出了本研究的主角:JEPA-WM(联合嵌入预测世界模型)

从名字也能看出来,这个模型与 Yann LeCun 的JEPA(联合嵌入预测架构)紧密相关。事实上也确实如此,并且 Yann LeCun 本人也是该论文的作者之一。更有意思的是,在这篇论文中,Yann LeCun 的所属机构为 Meta FAIR。不知道这是不是他在 Meta 的最后一篇论文?



论文标题:What Drives Success in Physical Planning with Joint-Embedding Predictive World Models?论文地址:https://arxiv.org/abs/2512.24497

JEPA-WM 继承了 JEPA 的衣钵,不再纠结于像素级的重建,而是在高度抽象的表征空间内进行预判。在这项研究中,团队试图通过对架构、目标函数和规划算法的全方位扫描,揭示究竟是什么驱动了物理规划的成功,并试图为机器人装上一个更理性的「大脑」。

JEPA-WM 核心方法

该团队将 JEPA-WM 的训练与规划流程形式化为一套统一的「终极指南」,重点在于如何在学习到的特征空间中模拟动力学。

1. 层次化的编码与预测架构



在训练阶段,模型主要由四部分交织而成:



2. 多步展开与动作调节细节



在训练时,模型不仅要预测下一帧,还要学会在没有真实观测反馈的情况下,基于自己的预测结果递归生成后续状态。为了提高效率,采用了截断反向传播(TBPTT),即只针对最后一步的预测误差计算梯度,而切断之前的累积梯度。

在动作信息如何干预预测过程上,该团队对比了三种关键方案:

特征调节(Feature Conditioning):将动作向量直接拼接到每一个视觉特征向量上,增加了预测器的隐藏层维度。序列调节(Sequence Conditioning):将动作作为一个独立的 Token 插入到 ViT 的输入序列中,通过注意力机制进行信息分发。自适应层归一化(AdaLN):动作嵌入被投影为缩放和偏移参数,在每一个 Transformer 块中动态调制归一化统计量,这能有效防止动作信号在深层网络中「淡出」。

3. 规划逻辑:在嵌入空间中寻找最优解



实验与结果:从模拟器到真实机械臂

研究团队在 Metaworld(42 个操纵任务)、Push-T(物体推送)、PointMaze(导航)以及 DROID(真实机械臂数据集)上进行了评估。

1. 规划器之争:梯度 vs 采样

实验结果揭示了一个有趣的现象:在像 Metaworld 这种成本曲线相对平滑的任务中,基于梯度的 Adam 或 GD 优化器表现惊人,因为它们能顺着梯度迅速找到目标。但在 2D 导航(Wall, Maze)任务中,梯度法极易卡在局部极小值(例如对着墙猛撞而不懂得绕过门口),此时基于采样的交叉熵方法(CEM)凭借其探索能力完胜。



此外,新引入的Nevergrad(NG)规划器在无需调参的情况下展现了与 CEM 相当的实力,尤其适合跨任务迁移。

2. 关键因素的「贡献度」

为了量化不同设计决策对智能体最终表现的影响,研究团队采用了一种严谨的控制变量法。

他们以一个基础配置(DINO-WM 结合 ViT-S 编码器及 6 层预测器)为基准,独立改变每一个核心组件,从而在复杂的系统工程中剥离出真正驱动性能增长的关键因子。通过在 Metaworld、Push-T 等多种异构环境下进行数以万计的幕(Episode)测试,实验揭示了世界模型在处理物理逻辑时的内在偏好。以下是影响物理规划成败的核心贡献因素:

本体感受的显著增益:引入机器人内部状态信息(如关节角度、末端位姿)能够一致性地提高规划成功率。在 Metaworld 任务中,这能有效减少机械臂在目标点附近震荡的情况,提供更精准的距离感知。



编码器架构:DINO 系列编码器(DINOv2/v3)在所有任务中均表现出对 V-JEPA 等视频编码器的明显优势。这归功于 DINO 强大的细粒度目标分割能力,这对于需要精确感知物体位置的操纵和导航任务至关重要。在视觉复杂度更高的真实数据(DROID)中,DINOv3 的优势进一步扩大。

动作调节技术的微妙差异:实验发现 AdaLN(自适应层归一化)调节技术在平均性能上表现最强,且计算效率更高。它通过在 Transformer 的每一层注入动作信息,有效防止了控制信号在深层网络传递过程中的消失,相比传统的特征拼接(ftcond)或序列拼接(seqcond)更具稳健性。



训练上下文长度的权衡:预测器需要至少 2 帧上下文来推断速度信息,这在 W=1 与 W=2 之间的巨大性能鸿沟中得到了印证。然而,盲目增加上下文长度(如 W > 5)反而有害,因为这会减少训练中看到的独特轨迹数量,并可能引入无用的梯度噪声。



模型规模:这是一个令人意外的发现:在简单的模拟环境(如 Maze, Wall)中,增大模型规模(从 ViT-S 到 ViT-L)非但没有帮助,反而可能由于嵌入空间过于复杂而导致规划效率下降。但对于复杂的现实数据(DROID),大容量的编码器和更深的预测器则展现出了明确的正相关收益,说明任务的物理复杂度决定了智能体所需的智力上限。

多步损失的对齐作用:在训练中加入 2 步展开损失能显著改善预测器的长时稳定性,使其训练任务与测试时的递归规划任务更加对齐。对于最复杂的 DROID 任务,最佳的展开步数甚至需要达到 6 步。

3. 提出的最优解

研究最终汇总所有洞察,提出了针对不同任务的最优配置:在模拟器中使用 ViT-S 配以 AdaLN,而在真实复杂场景中使用 DINOv3 ViT-L 配以 12 层深度的预测器。



在与 DINO-WM 和 V-JEPA-2-AC 的直接较量中,该模型在几乎所有维度上均取得了领先。

更多详情请参阅原论文。

来源:https://www.163.com/dy/article/KIEF3NPG0511AQHO.html
免责声明: 游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

相关攻略

Claude爆火研究漏引华人团队成果已致歉
AI资讯
Claude爆火研究漏引华人团队成果已致歉

近日,Anthropic发布了一项关于Claude模型内部“情绪机制”的新研究,却因未引用关键的前期工作而引发学术争议。原作者直接指出这一疏漏,促使Anthropic迅速回应并更新了论文引用。 发现这一问题的研究者是来自MBZUAI的研究生Chenxi Wang。她在阅读论文后敏锐地察觉到,这项研究

热心网友
05.20
复旦团队破解六十年数学物理难题成果登上数学顶刊
科技数码
复旦团队破解六十年数学物理难题成果登上数学顶刊

复旦大学等机构破解了困扰学界60年的经典数学物理难题,成果发表于国际顶尖期刊。研究系统分析了二维不可压缩欧拉方程中“猫眼流”涡旋结构在不同扰动下的稳定性,首次严格证明了其存在“合并不稳定性”,为理解磁重联等物理过程提供了新理论工具,其分析框架有望应用于更广泛的涡。

热心网友
05.16
7月25日外媒科学网站摘要:科学家警告,人类正无意间向宇宙泄露“地球坐标”
科技数码
7月25日外媒科学网站摘要:科学家警告,人类正无意间向宇宙泄露“地球坐标”

《自然》:一桩悬案了结? “砷基生命”论文终遭撤稿,但争议远未结束 科学界一桩持续了15年的公案,最近有了新进展。顶级期刊《科学》(Science)正式撤回了那篇曾引发轰动的争议性论文——该研究当年声称,在美国加州莫诺湖发现的一种细菌,能够用有毒的砷元素替代生命必需的磷来构建DNA,这直接挑战了我们

热心网友
04.17
科研产出占全球40%,顶刊数量却不足4%:中国学术期刊如何突围?
科技数码
科研产出占全球40%,顶刊数量却不足4%:中国学术期刊如何突围?

中国科研产出激增背后:学术出版话语权与经济成本的双重挑战 近期,在上海科学会堂举行的Insight Press(睿见出版)首批高质量学术期刊创刊仪式暨第十一期“好望角科学沙龙”上,科学家、出版机构负责人与期刊主编们齐聚一堂,共同探讨中国一流学术期刊的未来发展路径。当前,中国科学家正以前所未有的速度产

热心网友
04.16
中国科协:2026年NeurIPS会议资助调整与学者参会指引
科技数码
中国科协:2026年NeurIPS会议资助调整与学者参会指引

中国科学技术协会2026年3月31日发布告示:中国科协曾于2026年3月27日就2026年NeurIPS会议发表声明,本意是尽力维护我国关涉学者正当利益,其措施原则是清晰、适当的,没有发生变化。现就

热心网友
03.31

最新APP

宝宝过生日
宝宝过生日
应用辅助 04-07
台球世界
台球世界
体育竞技 04-07
解绳子
解绳子
休闲益智 04-07
骑兵冲突
骑兵冲突
棋牌策略 04-07
三国真龙传
三国真龙传
角色扮演 04-07

热门推荐

比特币现货持有者坚定持仓 BTC价格逼近115000美元关键阻力位
web3.0
比特币现货持有者坚定持仓 BTC价格逼近115000美元关键阻力位

现货持有者坚守仓位,比特币接近115,000水平 近期比特币(BTC)价格接近$115,000水平,市场整体情绪谨慎,但现货持有者依旧坚守仓位,显示出一定的多头信心。 市场现状与资金流动 那么,当前市场的资金究竟在如何流动?分析显示,一个有趣的现象正在上演:短线资金的流入其实相当有限,市场热度并未急

热心网友
05.23
瑞波币XRP现最强看涨形态目标6美元 近期回调后走势深度解析
web3.0
瑞波币XRP现最强看涨形态目标6美元 近期回调后走势深度解析

目录 要点介绍:分析师称XRP呈现“最强看涨结构”高位清算集中于2 90美元以上区域 周四,XRP价格稳稳站在了2 80美元上方。这个位置守住了,意味着什么?意味着市场向那个经典的“杯柄形态”目标价——6美元以上——又迈进了一步。 要点介绍: 先看几个核心数据:周四XRP报收2 82美元。技术分析显

热心网友
05.23
以太坊衍生品市场企稳 交易员聚焦4500美元关键阻力位突破
web3.0
以太坊衍生品市场企稳 交易员聚焦4500美元关键阻力位突破

近期,以太坊(ETH)衍生品市场经历了短暂的闪崩,但随后价格快速企稳,交易者开始关注关键突破点——$4,500水平。 ETH衍生品市场现状 市场情绪往往在剧烈波动后显露真容。从最新的链上数据和期权、永续合约的交易情况来看,那场短暂的闪崩更像是一次压力测试——结果是,市场波动率显著下降,多空力量似乎进

热心网友
05.23
狗狗币DOGE暴涨11%交易量激增四倍 市场反弹行情能否持续
web3.0
狗狗币DOGE暴涨11%交易量激增四倍 市场反弹行情能否持续

DOGE单日暴涨11%,交易量激增四倍,市场风向变了? 最近,加密货币市场又热闹起来了。DOGE(狗狗币)上演了一出“旱地拔葱”,价格单日暴涨11%,更关键的是,成交量直接翻了四倍。这种“价量齐升”的场面,无疑给整个迷因币板块打了一针强心剂,市场情绪肉眼可见地回暖了。 DOGE价格拉升原因分析 那么

热心网友
05.23
欧易OKX官方APP下载指南 安全交易入口与安装教程
web3.0
欧易OKX官方APP下载指南 安全交易入口与安装教程

如何安全获取欧易(OKX)官方APP?一份详尽的下载与使用指南 Binance币安 欧易OKX ️ Huobi火币️ 当人们谈论“欧易易欧”时,指的往往是那个全球顶尖的数字资产交易平台——欧易(OKX)。作为业务版图庞大的行业巨头,其官方APP无疑是用户进行交易、查看行情和管理资产的核心工具。不过,

热心网友
05.23