一个“可以走进去”的世界
体验 Olympus 的方式,更像是在玩一个由 AI 实时生成的游戏,而不是看一段拍好的片子。你进入一个实时生成的 3D 场景,用移动、跳跃等按键操控角色,在里面避开障碍、攀爬树木和山体,画面随着你的操作即时生成、即时响应。Olympus 实时可交互演示:用户通过按键操控,画面随操作即时生成,跳跃、攀爬、攻撃、射箭、游泳等动作连贯响应。 这套体验背后,Olympus 最直接的特质就是“实时可交互”:你下达指令的瞬间,世界立刻呈现并回应。而它更大的野心,在于定位——它不想只做一个跑在特定场景里的模型,而是瞄准一个统一的世界模型(unified world model),用同一套底层能力同时覆盖数字世界和物理世界。这意味着,它既能服务数字环境里的交互,也能面向机器人、自动驾驶这些需要和真实物理世界打交道的场景。
真实、连贯、经得起时间的考验
衡量一个世界模型,维度可以有很多:分辨率、时长、交互方式。Olympus 在这些维度上表现都不错,但 Video Rebirth 真正押注的差异化,落在三个“一致性”上。 第一是逼真的物理一致性。在 Olympus 生成的世界里,角色能完成避障、攀爬树木和山体这样的连续动作,物体的运动、场景的结构,在不同视角和连续动作中始终保持一致。世界模型最难的地方,从来不是把某一帧画好,而是让整个场景在持续的交互和运动中始终“讲得通”:不穿帮、不穿模、不错乱。这正是 Olympus 着力最深的地方。 第二是声画同步的一致性。角色在草地上走动的脚步声、起跳落地的声响、奔跑时的喘息——画面里发生的每一个动作,都有与之贴合的声音。这类细节看似不起眼,却决定了“走进一个世界”的沉浸感是否完整。声画一旦错位,再逼真的画面也会瞬间出戏。 第三是长程记忆一致性。一个真正沉浸的世界,得经得起时间的考验:你离开一处环境,过一会儿再回来,它依然是你离开时的样子。这种“记得住”的能力,是 Olympus 着力解决的问题。走进 Olympus 的技术内核
任何一个能“理解世界”的模型,都得先有足够强的“呈现世界”的能力。Olympus 就建立在 Video Rebirth 的视频生成引擎 BACH 之上。 2026 年 5 月,BACH 通过 Artificial Analysis Video Arena 的独立盲测,首次登榜便位列全球第 6,是榜单上排名最高的初创公司模型。在 Video Rebirth 看来,这层地基不可或缺:没有工业级的视频生成,就撑不起一个视觉上足够真实、连贯的世界模型。 在这层地基上,Olympus 的训练大致经历了三个阶段:先是在大规模可交互场景数据上做领域微调,让模型熟悉可交互世界的生成;再引入因果建模与控制注入(Causal Teacher),教会模型在给定一段历史画面和一个当前动作后,应该生成怎样的后续画面;最后通过自回归蒸馏,提升生成的效率和连贯性,支撑起长时稳定的交互。 值得注意的是,Olympus 并不靠“把物理规律写进去”来理解世界。它没有一条条编码重力公式或碰撞规则,而是主要从数据中隐式地学习。在观察了大量视频之后,物体如何下落、如何碰撞、光如何变化——这些规律会自行内化到模型的权重里。
BACH 生成的真实场景演示:角色人脸、动作细节、光影变化与物理交互呈现出较强的真实感与连贯性。 真正让这个世界“活”起来的,是它对操作的即时响应。用户按下的每一个按键、输入的每一条指令,都会被编码成一段 embedding 送入模型,再通过 cross-attention 调制接下来生成的画面。于是操作和画面之间几乎没有割裂感:你往前走,世界就往前展开;你转身,视角随之改变,一切都在实时发生。 而要让世界“记得住”,Olympus 靠的是两件事。一是数据策略,专门录制了一部分场景重访数据,让模型学会“记住来时的路”;二是在推理阶段,高效地在 KV cache 中检索并复用历史状态,让模型在长时间交互中保持前后一致,而不必每一帧都从零开始理解世界。 “实时”本身,是一道不小的工程难题。让模型在按下按键的瞬间就生成出连贯的下一帧,背后是一整套推理层面的优化。为此,Olympus 同时采用了多项推理加速策略:通过多卡并行,把不同模态的计算拆分到多张计算卡上同时进行,避免相互排队;通过状态缓存,把场景的初始状态存下来,重复进入同一场景时无需从头再来;通过异步计算,让解码与 KV cache 等计算环节并行推进,不必一步做完再做下一步。这些策略协同运作,共同支撑起实时、流畅的交互体验。 值得一提的是,Olympus 也是已知最早在 AMD 先进的 MI350 系列上完成部署并运行的世界模型。Olympus 本身已围绕实时交互做了大量系统级优化,而 AMD Instinct MI350 系列配备的 288GB HBM3E 超大显存,进一步放大了这些优化的效果:这让 Olympus 能在更长时序、更复杂场景和更高并发交互下,为缓存大量中间状态提供了更充足的空间。换句话说,Olympus 的效率来自模型与系统设计本身,MI350 则为其大规模、低延迟部署提供了更理想的硬件承载。这背后,也体现出 Video Rebirth 与 AMD 在算力基础设施上的深度协同。 而支撑 Olympus 不断变强的,是一个由真实世界视频和合成数据共同驱动的飞轮。这两类数据各补对方的短板:真实世界视频带来丰富、真实的物理与视觉信息,但“动作和画面的对应关系”往往是模糊的;合成数据则恰好能提供精准的“动作—画面”配对,比如在可交互的游戏类场景中,每一次按键操作和它引发的画面变化都明确对应。真实数据教模型“世界长什么样”,合成数据教模型“动作会带来什么后果”,两者互相补充,循环迭代,驱动飞轮越转越快。
