游乐游手机版
首页/AI热点日报/热点详情

昆仑万维方汉夯实世界模型技术底座让AI懂世界能行动

类型:热点整理2026-07-23
AI行业核心从“生成”转向“理解与交互”,世界模型成为关键底座。技术路径收敛至端到端模型,通过异构数据解决数据瓶颈。具身智能、游戏行业及AI音乐视频是落地方向,中国制造业优势助力具身智能竞争。

过去两年,AI行业的核心聚焦于“生成”技术;但从2026年起,趋势发生了转变——核心焦点将转向“理解”与“交互”。在WAIC 2026上,昆仑万维董事长兼CEO方汉明确判断:AI必须真正理解物理世界的运行规律,并与真实环境形成闭环互动。而实现这一突破的关键基础,正是世界模型。

回顾近年来的产业发展,文生图、文生视频已从新鲜事物演变为日常工具。然而,行业对“生成”能力的追逐,正悄然让位于一个更根本的追问:AI能否真正“看懂”并“介入”物理世界?从科技巨头纷纷布局Physical AI,到具身智能赛道持续升温,一个共识日益明确——让AI“理解世界”、“采取行动”,才是下一阶段竞争的核心。

那么,世界模型的技术路径究竟该如何选择?方汉认为,答案已日益清晰。自动驾驶经过多种技术路线的竞争,最终收敛到端到端的FSD模型。世界模型也将遵循同样的路径——收敛到端到端模型。但瓶颈也十分明显:数据规模。世界模型需要海量训练数据,而传统精密采集方式成本高昂。

突破口在哪里?方汉给出的解决方案是异构数据。“异构数据成本低、场景丰富、采集门槛极低,将成为世界模型预训练的主要数据来源。而更优质的精密数据则用于后训练,两者互补。”有了数据上的突破,技术落地应朝哪个方向?方汉将其分解为三个明确的方向。

第一个方向:世界模型将走出屏幕,融入物理世界。具身智能正从实验室迈向真实环境,这意味着机器人在行动前需要先对环境进行推演——预判动作后果、评估环境变化、调整应对策略。谁能突破这种能力,竞争焦点将从单一任务转向陌生环境下的通用模型能力。“谁能训练出在复杂场景中依然‘看得懂、做得对’的模型,谁就能获得物理智能时代的入场券。”方汉说,“这也是中国智能制造和机器人产业真正急需的底层能力。”

第二个方向:游戏行业将率先被世界模型颠覆。开放世界游戏将不再依赖数百人团队数年的手工搭建。方汉预计,未来三到五年,世界模型将成为游戏行业的基础设施,从根本上改变内容生产方式。而国产模型已在这一赛道领跑全球。作为昆仑万维世界模型系列的最新迭代,Matrix-Game 3.5在本届WAIC上带来了技术升级——聚焦可交互世界模型技术,实现了Patch级别的记忆注入与系统级性能优化,5B模型在720p分辨率下可实现单卡20FPS实时生成,并具备1分钟记忆能力。

第三个方向:AI音乐、AI视频等工具将从技术试验演变为大众创作工具,推动AIGC的深层发展。此次WAIC同步发布的Mureka v9.5与O3音乐大模型,其中v9.5版本聚焦“消除AI味”——不再依赖声部堆砌和复杂编配制造“震撼”的第一印象,而是在真实音乐框架中以更克制的方式处理编配、人声与情绪。O3则让模型在生成过程中持续审视当前表达:局部旋律是否仍服务于全曲目标,编配是否遮蔽人声,情绪是否提前透支,结构是否正偏离最初意图。

值得一提的是,当前一首歌经常与视频一起被消费——短视频、游戏、影视预告、品牌片和虚拟人演出,都需要声音与画面共同表达。Mureka此次升级,将音乐与视频MV整合到同一条创作链路中。歌词决定叙事、节拍决定剪辑、旋律决定记忆点、画面决定传播场景,Agent要做的,是让这些信息在同一个创作目标下持续传递,而不是简单拼接几个生成工具。

更关键的是,Mureka已从单一的音乐生成工具演进为完整的“版本化制作”平台。方汉强调,这并非为了替代音乐人,而是大幅降低创作门槛,让更多人的表达得以释放。技术普惠的逻辑在于,门槛每降低一分,能参与的人就多一圈。他以网络小说行业为参照:当创作门槛降低后,创作者规模会急剧扩大,市场空间不断扩容。“因为视频比文字覆盖的人群更广,现在模型能力已经足够,我们要做的就是让提示词写得不好的人也能生成效果逼真的视频。”

最后,展望具身智能赛道的竞争格局,方汉认为中国的独特优势正在显现。“中国是全球数据采集设备的硬件产地,拥有门类齐全的工业体系和庞大的服务业人群。因此,中国在具身智能赛道上的竞争态势要比文本大模型有利得多。”——这份底气,来自制造业的深厚积累,也来自对技术落地路径的清醒认知。

来源:https://tech.huanqiu.com/article/4SV22cqdjjQ

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。