7月9日,蚂蚁灵波低调发布了一项重要消息——LingBot-Video正式开源。这是全球首个基于混合专家(MoE)架构、专为具身智能打造的视频生成基础模型。与那些面向短视频或影视特效的生成模型不同,LingBot-Video的核心目标非常明确:让机器人的视觉系统理解世界,并学会如何行动。为此,团队重新设计了视频预训练范式,在推理效率、物理合理性、动作理解以及任务完成度上实现了全面突破,为视频基础模型从“数字内容创作”转向“具身智能”构建了全新的开源底座。
实测数据充分证明了其性能优势。在北京大学联合字节跳动发布的机器人操作视频基准RBench上,LingBot-Video总得分达到0.620,而行业熟知的Wan2.6为0.607,Seedance 1.5 Pro为0.584,Cosmos3 Super为0.581。RBench榜单专门用于评估模型能否生成符合真实物理规律的机器人行为,简单来说,就是检验模型模拟的动作是否真实可信。LingBot-Video在此项测试中领先,意味着它在动作连贯性和任务完整性方面确实更胜一筹。



训练环节也进行了硬核升级。LingBot-Video引入了一套多维强化学习奖励系统,除了常规的美学评分、提示跟随度、运动一致性等指标外,还重点加入了物理合理性和任务完成度两个维度的对齐约束。这样训练出来的模型,生成的视频内容更加贴合真实世界运转规律,也更符合机器人在现实场景中执行任务的实际需求——不仅要“看起来像”,还要“做得对”。
据悉,LingBot-Video的应用场景涵盖了机器人动作预测、仿真数据生成、动作条件建模、世界模型研究等多个方向。目前该模型已正式开源,感兴趣的团队可以直接使用、修改或运行实验。
