2026年7月20日,上海西岸,世界人工智能大会的一场论坛上,昆仑万维扔出了一颗重磅冲击波。这家深耕AI多年的公司,借着“世界模型与多模态范式跃迁”专场的舞台,一口气宣布了核心模型的全面升级——Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型,覆盖了从世界模型到AIGC创作的多个赛道。而最引人注目的,是昆仑万维董事长兼CEO方汉在演讲中掷地有声的一句话:2026年,是“世界模型元年”。
这句话,意味着AI的核心命题正在发生根本性转折——从过去两年围绕“生成”文字、图像、视频、音乐的竞赛,转向对物理世界的“理解”与“交互”。
方汉的三大产业预判:AI从“会生成”走向“懂世界”
在论坛的主旨演讲中,方汉系统性地抛出了三个关键预判,每一个都指向同一个方向:让AI真正理解物理世界的运行规律,并能与真实环境闭环互动。
第一,世界模型将走出屏幕,进入物理世界。具身智能正在从实验室走向真实环境。这意味着,机器人在行动前必须先进行环境推演——预判动作后果、评估环境变化、及时调整策略。谁能训练出在复杂场景中依然“看得懂、做得对”的模型,谁就拿到了物理智能时代的入场券。这不仅是技术突破,更是中国智能制造和机器人产业真正亟需的底层能力。
第二,游戏行业将率先被世界模型改变。开放世界游戏不再需要数百人团队花数年时间手工搭建。Matrix-Game 3.5让虚拟世界随玩家行动实时生长、持续演化。未来三到五年,世界模型将成为游戏行业的基础设施,彻底刷新内容生产方式。而国产模型,已经在这一赛道领跑全球。
第三,AI音乐、AI视频等工具将从技术试验变成大众创作工具。Mureka作为中国最强、全球前两名的音乐生成模型,率先去除了“AI味”,让普通人也能把模糊灵感转化为有情绪、有温度的作品。这不是替代音乐人,而是大幅降低创作门槛,让更多人的表达得以释放——这背后,是整个AIGC产业创作生态的根本性改变。
三个预判,指向同一个结论:AI的下一个十年,主题是“理解世界、能行动”。
Matrix-Game 3.5:Patch级记忆注入,让世界模型真正“能交互”
在论坛上,Skywork首席科学家成宇正式发布了Matrix-Game 3.5世界模型。这次升级,聚焦的是可交互世界模型技术,核心突破在于Patch级别的记忆注入与系统级性能优化。

成宇解释,世界模型是具身智能的“无限数据引擎”。传统数据采集面临人工成本高昂、实机采集耗时耗力的痛点,根本无法满足大模型规模化训练的需求。Matrix-Game 3.5构建了一套全新的无限数据生产体系,突破传统瓶颈,打造了三条自动化数据生产管线,能输出Video+Pose+Action+Language的高质量训练数据。目前,已积累超过500万高质量视频切片、超1万有效训练小时数,覆盖1200余个游戏场景。
在技术架构上,最值得关注的是Patch Memory的引入。简单来说,模型将历史帧切分为带有3D坐标的Patch Memory,推理时根据当前相机视锥检索可见Patch,并重新投影到当前视角,形成Mosaic后作为Memory Token注入DiT。这实现了长期一致性的Patch级空间记忆,带来了四大核心优势:更准确的空间记忆检索与跨帧一致性、更稳定的相机运动生成、最大程度保留基座模型动态生成能力的In-context Learning,以及用户可自由编辑记忆块的可控记忆能力。
更值得一提的是,Matrix-Game 3.5在推理加速上做到了全链路优化。通过“减少模型吞吐+DiT模型优化+VAE剪枝”三重手段,实现了单卡20FPS、720p分辨率下的实时推理。这不仅是技术数字,更是让高质量世界模型真正具备实时交互能力的关键一步。
Matrix-Game从1.0到3.5始终坚持开源路线。3.5版本宣布核心架构开源,吸引全球开发者共建生态。此前,DiT作者、纽约大学助理教授谢赛宁团队基于Matrix-Game 2.0的开源底座,发布了全球首个多人视频世界模型Solaris;NVIDIA和浙大联合发布的Light Interaction基于Matrix-Game 3.0模型研发。而NVIDIA的SANA-WM和Adobe的RELIC等国际头部大厂的世界模型,均将Matrix-Game相关模型作为对比基准。这些来自学术圈和行业一线的实际使用,印证了这套开源方案的基础模型价值。
Mureka v9.5与O3:最没有“AI味”的AI音乐模型
如果说Matrix-Game 3.5是技术硬核的展示,那么Mureka v9.5与O3音乐大模型的发布,则是论坛最具情感冲击力的时刻。

从SkyMusic 1.0内测到Mureka v9.5&O3,昆仑万维的音乐模型走过了一条从“作品成立”到“创作可控”再到“多模态创作”的演进路径。而v9.5版本首次喊出“最没有AI味的AI音乐模型”这一口号——它不再依赖声部堆砌和复杂编配制造“厉害”的第一印象,而是在真实的音乐框架中,以更克制的方式处理编配、人声、情绪与Prompt意图,让音乐表达更自然、更真诚。
O3建立在新版V9.5之上,通过test-time scaling扩展MusiCoT的推理过程。它不是简单地“生成得更多”或“想得更久”,而是让模型在生成过程中持续审视当前表达:局部旋律是否仍服务全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正在偏离最初意图。额外推理空间被用于回看偏差与自我修正,使音乐CoT能够逐步收敛,而不是一次决定后一路向前。
从评测结果来看,V9.5沿着MusiCoT路线完成了更扎实的底座升级:旋律、人声、音质和编曲全面提升,指令精准度从6.92提升至7.62。V9.5负责把歌做得更自然,O3则负责让模型在交付前多看、多想、多修一遍。
今天,一首歌经常和视频一起被消费。短视频、游戏、影视预告、品牌片和虚拟人演出,都需要声音与画面共同表达。Mureka这次升级,把音乐与视频MV接进了同一条创作链路。用户可以从一张图、一段视频或moodboard开始,让系统理解画面的节奏、人物、空间和情绪,再生成与之匹配的音乐;也可以从一首歌开始,让Agent理解歌词叙事、节拍编曲和情绪起伏,继续生成角色与MV的视觉方案。歌词决定叙事、节拍决定剪辑、旋律决定记忆点、画面决定传播场景——Agent要做的,是让这些信息在同一个创作目标下持续传递,而不是把几个生成工具简单拼在一起。
更重要的是,Mureka已从单一的音乐生成工具演进为完整的“版本化制作”平台。同一创意可快速生成多版本,支持在旋律、人声、结构等维度进行局部保留与替换;Studio将“操作DAW”转化为“指挥创作”,降低门槛、抬高上限。同时,Mureka推出Character功能——一段声音、一张照片即可生成专属歌手角色,并贯穿歌曲、MV全链路;AI配乐能自动分析视频画面的场景、动作与情绪,创作更贴合内容的音乐;Mureka Agent则通过自然语言一次对话调用整曲生成、单轨生成、Remix、延伸、MIDI导出、声音克隆等全部能力,全程无需切换界面。
正如昆仑万维所提出的愿景:AI音乐不再是简单的消费内容,而是升级为一种自我表达的语言。用户不仅是被动聆听者,更是主动表达者与参与者。Mureka正以模型能力、创作工具与平台分发的完整闭环,重新定义AI时代的音乐创作生态,让每个普通人的灵感都能有温度地落地,从“一个想法”到“歌词—人声—角色—歌曲—MV”的完整创作链路,全面释放AIGC的深层创作力。
