回顾过去一年AI领域最受瞩目的方向,世界模型无疑是最热门的话题之一。过去18个月内,该领域的公司累计获得超过100亿美元的投资,图灵奖得主杨立昆(Yann LeCun)甚至断言,未来三到五年内,世界模型将取代大语言模型,成为AI领域的主流范式。
然而,技术挑战也在逐步显现——长期记忆能力不足、相机控制精度欠佳、实时交互能力有限,许多产品更像是“生成视频”,而非真正“交互世界”。更令人担忧的是,大多数世界模型对物理规则几乎缺乏理解:它们可以生成一条狗奔跑的画面,却无法理解狗的四条腿为何必须按照特定顺序落地。
在这一片混沌之中,昆仑万维旗下的Skywork团队于7月19日世界人工智能大会WAIC 2026期间,正式发布了世界模型Matrix-Game 3.5。该版本的核心能力在于:根据用户动作和事件指令,持续生成可交互的世界,并在长时序生成过程中保持场景结构、空间布局、角色身份和动态内容的一致性。简而言之,它瞄准了游戏、机器人、具身智能和XR等需要持续交互的落地场景。
一、三大维度升级,实现端到端实时推理
3.5版本从模型吞吐优化、DiT推理优化和VAE解码优化三个维度,构建了一套完整的系统级加速方案,最终实现了端到端的实时推理。
首先看模型吞吐优化。Skywork团队通过蒸馏技术将采样步数压缩至3步,并设计了分块因果推理(Chunked Causal Inference),结合KV Cache、Patch Latent和预测Latent。在保证生成质量的前提下,单次推理的吞吐量显著提升,多步采样带来的整体延迟也明显降低。
其次是DiT推理优化。团队针对推理中的热点进行了系统级优化,包括FFN INT8量化、Memory Retrieval Optimization以及Torch.compile等推理加速技术。这些优化几乎不影响模型效果,但DiT推理时间进一步缩短。
最后是VAE解码优化。这里采用了3.0版本中的MG-LightVAE,对Wan2.2的VAE Decoder进行了约75%的结构化剪枝。在保持接近原始Wan VAE重建质量的同时,VAE解码延迟大幅降低,不再成为整个系统的性能瓶颈。
这三项技术结合,Matrix-Game 3.5最终在单张GPU上实现了720P分辨率、约20FPS的实时流式视频生成。坦白说,这确实是一项不小的突破。
二、四大技术优势,破解长时一致性问题
据Skywork团队透露,此次3.5版本拥有四大核心差异化优势,值得深入探讨。
1、长期记忆机制
关于长期记忆,早期版本的做法是原样存储历史帧,推理时再检索相关帧拼接到上下文中——这占用了大量上下文窗口,且跨帧拼接时容易出现画面冲突。
3.5版本改变了策略:将历史帧切分为三维坐标系下的空间块,检索时按空间位置匹配,再重新组合成当前视角的记忆图。这样一来,画面一致性更高,相机轨迹更稳定,且记忆可以随时更新、替换、删除。
Matrix-Game 3.5的Patch Memory,是业界首个几何对齐的Patch级长期记忆机制。行业评测显示,目前主流世界模型的“物体重现得分”均未超过0.6——即相机离开再返回时,场景中的物体可能消失。而Patch Memory将局部图像patch作为基本记忆单元,在空间上按需检索、对齐和复用历史内容,使模型在相机重访场景时,能够准确找回之前观察过的空间内容。
2、动静解耦记忆机制
此外,模型还采用了动静解耦记忆机制。Patch Memory负责记录静态场景结构,主体参考Token则负责维持动态主体的身份一致性。动态物体在写入记忆前会被过滤掉,避免移动物体被误判为多个静态物体。
3、相机控制精度
传统视频模型使用的3D RoPE,仅编码时间和二维空间位置,难以表达不同视角之间的真实几何关系。Skywork团队发现,之前将鼠标信号通过Self-Attention注入、键盘信号通过Cross-Attention注入的做法,虽然直观,但每次加入参数都会破坏模型对原始视频分布的认知,需要大量额外训练来修复基础能力。
因此,在架构层面,3.5版本做出了关键调整:不再将动作控制信号作为额外参数注入模型,而是采用相机位姿相对编码PRoPE机制,通过相机投影矩阵让模型直接感知相机相对位姿。
Matrix-Game 3.5将PRoPE与Warped RoPE相结合——Warped RoPE可以重新定义记忆Patch在当前视角下应出现的位置。简而言之,位置编码从简单的时空索引,升级为具备几何语义的世界表示。
4、轻量化框架
轻量化的交互框架是另一个值得关注的特性。除了角色Reference Adapter之外,模型的核心功能几乎无需新增模型参数,即可实现交互世界建模,并且能够快速适配不同的视频基础模型。
三、令行业头疼的数据问题,成为护城河
除了技术优势,Matrix-Game 3.5还有一项值得深入探讨的“技术护城河”,即数据基础建设方面的成果。
如果说大语言模型的瓶颈是算力,那么世界模型的瓶颈首先就是数据。
互联网视频的数据分布,与世界模型所需的物理世界数据,本质上是两回事。互联网上大量内容是娱乐性的,甚至包含反物理规律的内容——例如人类可以飞行。而世界模型需要的是接触丰富、包含推拉拧拽等动作、涵盖柔性物体、摩擦力、流体等多样物理交互的真实数据。
更棘手的是数据规模。国际领先的大语言模型,预训练数据已达100万亿Token,换算成语音,大约相当于100亿小时的说话量。而物理世界数据的信息密度远低于文本,要实现更高阶的物理常识判断,可能需要“亿小时”量级的真实世界数据。
那么,Skywork团队是如何解决这一问题的?他们给出的方案是三条自动化数据生产管线:
第一条基于Unreal Engine 5的自主探索管线。在UE5中搭建常见游戏场景,部署RL Agent进行自由探索,在探索过程中实现毫秒级同步采集,完整记录视觉画面、动作状态及相关语义信息。
第二条是跨游戏自动化控制与探索管线。覆盖《GTA V》《荒野大镖客2》《赛博朋克2077》等主流3A游戏,实现了跨游戏的自动控制、自动探索、自动录制和自动标注。
第三条是开放平台视频自动挖掘管线。从开放平台自动获取游戏视频,通过VLM评分筛选高质量片段,自动完成镜头切分、过滤与结构化标注。
此外,Skywork团队还建立了一套自动化的离线标注管线,为每条视频估计相机位姿(Camera Pose)、米制深度(Metric Depth)以及相机内参。同时,基于多模态大模型,构建了视频Prompt自动标注系统——以固定长度的视频窗口作为标注单元,通过抽取关键帧理解场景内容,生成覆盖整个窗口的统一描述,在保证时序一致性的同时,大幅降低了标注成本。
为了评估数据质量,团队还搭建了Scene-Quality自动评估系统,能够对每个场景进行多维质量分析,并输出统一的质量评分。从数据源头到质量把控,这一整套体系确实堪称一条护城河。
四、不到两年四次迭代,被英伟达和Adobe作为基准
从1.0到3.5,Matrix-Game系列的进化路径非常清晰。
2025年3月,昆仑万维发布了Matrix-Game 1.0,这是早期可交互世界模型的一次概念验证;
2025年8月,2.0版本发布,实现了单卡B100、720P分辨率下25FPS的实时交互,成为业界首个开源方案;
2026年3月,3.0版本终于在720P下实现了40FPS的实时生成,补齐了世界模型公认的三大短板——记忆、长时程、实时性。
而此次正式发布的3.5版本,最大的变化是:从游戏场景全面向真实场景扩展。它支持多风格动态切换与指令控制,引入了NPC交互能力,并全新升级了长时记忆能力。
更难得的是,Matrix-Game始终坚持开源策略。此前,DiT作者、纽约大学助理教授谢赛宁团队,基于Matrix-Game 2.0的开源底座,发布了全球首个多人视频世界模型Solaris。英伟达和浙大联合发布的Light Interaction,也是基于Matrix-Game 3.0进行研发。此外,英伟达的SANA-WM和Adobe的RELIC等国际头部大厂的世界模型工作,均将Matrix-Game相关模型作为对比基准——这些来自学术和工业界的实际应用,本身就证明了这套方案的价值。
结语:昆仑万维的目标,是更广阔的物理世界
昆仑万维董事长兼CEO方汉给出了一个判断:2026年是“世界模型元年”。这一判断意味着,今年世界模型的发展路径将逐渐收束,数据和训练的难题也会被逐一攻克。
Matrix-Game 3.5的定位,正是在回应这一判断。它不仅仅在做渲染,也不仅仅在做规划,而是将状态理解和动作生成放在同一个框架中训练,让模型同时学会“理解世界”和“行动于世界”。
Matrix-Game 3.5同时也是昆仑万维“4+3”AGI战略的核心组成部分。在这一战略框架下,视频模型SkyReels、音乐模型Mureka、世界模型Matrix-Game、基座文本与多模态模型构成了四大技术底座,AI短剧、AI音乐、AI游戏三大平台经济体则承载着商业化落地。
在WAIC 2026的专场论坛上,昆仑万维集中完成了四大核心模型的全球首发——世界模型只是其中的一块拼图,但也是最关键的一块。
Matrix-Game 3.5正式亮相后,行业关注的将不仅是它的技术参数,还有它能否真正跨越游戏与物理世界之间的那道门槛。
昆仑万维的目标,其实指向的是更广阔的物理世界。
