李飞飞发布世界模型重大更新:单GPU实时生成3D场景
当业界巨头还在忙于采购显卡、扩充算力来支持他们的Sora 2视频生成模型时,李飞飞的The World Labs实验室正在用另一种思路重新定义现实。他们仅用一张显卡,就构建出了可供探索的数字世界。团队刚刚发布了一项名为RTFM的创新技术,这套实时世界生成模型正在突破想象力的边界。
与传统图像生成工具不同,RTFM不仅能从单张图片生成可供自由漫步的3D场景,更重要的是实现了在单个H100 GPU上的流畅运行,真正做到了实时生成与交互。
目前,RTFM研究预览版已经开放体验,并提供了可实际操作的Demo演示。

RTFM体验地址:https://rtfm.worldlabs.ai/
令人惊喜的是,这个Demo被命名为FRAMEBOY——结合复古风格的界面设计,瞬间唤起了我们对经典Game Boy游戏机的时代记忆。
眼前这个光影交错、反射细节丰富且实时变化的世界,某种程度上不正是我们儿时梦想中的游戏场景吗?
超越静态生成,实现动态交互
RTFM的核心突破在于能够实时生成可供用户交互的视频内容。系统从一张静态图片起步,通过实时渲染技术构建出完整的3D探索场景。
与传统模型相比,RTFM能够学习并呈现出极其复杂逼真的视觉效果。无论是光滑大理石地面的倒影细节、阳光照射下物体的自然阴影,还是透过玻璃看到的景象,模型都能精准地模拟出真实世界的视觉效果。
RTFM不依赖传统的图形学编程,而是让模型通过对海量视频数据进行端到端学习,持续优化生成的视觉效果。

支撑这一能力的,是RTFM设计团队提出的三大核心原则。
效率优先:将未来拉近现实
计算需求始终是世界模型发展的主要瓶颈。无论是像Sora这样的AI生成视频,还是Google尚未正式上线的Genie 3,都意味着巨大的算力挑战。
相关研究表明,要实时生成4K 60fps的交互视频流,AI模型每秒需要处理的tokens数量约等于一本《哈利·波特》的文字总量。
而在超过一小时的交互过程中,要保持生成内容的连贯性,需要处理的上下文将超过1亿个token。这对当前的计算基础设施而言,既不够现实,也难以承受。
李飞飞团队的目标是"在今天的硬件上,运行明天的模型,并提供最高保真度的预览体验。"
通过对架构、模型蒸馏和推理过程的极致优化,以及整个系统的重新设计,RTFM成功实现了仅使用单个H100 GPU就能进行交互式帧率推理,实现实时生成。
可扩展性:从视频模型到世界模型
传统3D引擎依赖三角网格、高斯点云和体素渲染等显式结构,完全基于复杂的计算机图形学知识。每个物体都需要建模、上材质、打光、烘焙阴影。这与我们之前介绍的混元3D世界采用的方法类似,它们主打的是实现3D全管道的生成效果。
The World Labs选择了完全不同的技术路线。RTFM不会构建任何显式的3D模型,而是使用了类似Sora的"自回归扩散Transformer"架构,直接从视频帧序列中学习世界规律。
举例来说,模型不再需要知道"这是一堵墙"或"那是一盏灯",而是通过成千上万段视频的学习,理解什么是"空间感",学会从输入的2D图像序列中预测出下一个新的视角画面。
与生成3D资产的路线不同,RTFM能够更好地利用不断增长的数据和算力,从而实现无限扩展。
持久性:让世界保持一致
大部分视频生成模型存在一个天然缺陷——它们没有记忆。即便现在的Sora能一次性生成25秒的震撼画面,但视频生成结束后,世界就终结了,无法提供持续的交互体验。
如果要记住所有场景,计算负担势必随着探索的深入而无限累积。
RTFM尝试解决的正是让生成的世界具备持续存在的能力。它引入了一个名为"空间记忆"的机制,为生成的每一帧画面都赋予了在3D空间中的精确"姿态"。
在生成新画面时,模型会采用一种"上下文杂耍"的技术,只调用新画面附近位置的帧作为参考,而非全局内容。
这使得RTFM能够让我们反复进入这个世界,离开再回来,而不会增加计算负担。
目前,RTFM的Demo体验时间只有3分钟,时限过后它还是会忘记这个世界。我在那个Demo里面拖动左右两个摇杆玩了很久,想起李飞飞之前说过,空间智能应该是AGI的下一个方向。
未来是否真的有机会,让现实世界与虚拟世界之间产生明确的联系,当前世界模型需要加载的内容还有太多。
毕竟,即便单个H100 GPU售价也大约在25000美元以上。但是当算力的价格下降,当算法再快一点;我们或许能看到,真正意义上的世界模型"大更新"照进现实的那一天。
AI原生产品日报频道具 前科相关攻略
1月21日消息,据全球权威科技信息分析机构科睿唯安(Clarivate)发布的2026年度“全球百强创新机构”榜单,中国存储芯片龙头企业长鑫科技首次登上该榜单。值得注意的是,长鑫科技也是本年度7家上
【科技报道 记者 林迪】“回顾过去五年,罗克韦尔自动化深切感受到了中国市场的蓬勃发展与持续释放的韧性与活力。站在‘十五五’的新起点上,近期一系列的政策更新为我们指明了更为清晰的在华发展方向。”罗克韦
1月15日消息,近日,小米产业投资部合伙人潘九堂又一次公开表示,模仿是创新基础,但没有哪家企业只靠模仿可以取得成功。之前,潘九堂公开表示,国内车企上一波做纯电大多对标特斯拉,但都不太成功。小米SU7
12 月 23 日消息,创新现已推出一款型号为 ACE SXFI 的 TWS 蓝牙耳机,该机主打空间音频、ANC 混合主动降噪,定价为 699 元。该耳机整体采用黑金配色,拥有 IPX5 认证,耳
当前,全球汽车产业正在经历一场百年未有之大变局。汽车革命的上半场是电动化,解决了动力的清洁化问题,中国已走在世界前列;在“十四五”收官与“十五五”谋篇布局的衔接期,汽车产业界的共识是,自动驾驶所代表
热门专题
热门推荐
MiniCPM-o 4 5是什么 在探索更自然、更智能的人机交互道路上,我们始终在期待一个“全能型选手”的到来。如今,这个角色或许已经登场。面壁智能最新开源的MiniCPM-o 4 5,一个仅拥有90亿参数的全模态大模型,正致力于重新划定“智能对话”的边界。 它彻底颠覆了传统一问一答的“对讲机”式交
Binance币安 欧易OKX ️ Huobi火币️ 想在2025年安全获取欧易OKX的正版APP?其实秘诀就一个:认准官方网站,避开所有仿冒和可疑的下载渠道。要知道,欧易现已统一更名为欧易OKX,其核心业务始终围绕数字资产交易及相关服务展开。 确认官方网站地址 第一步,打开浏览器,手动输入欧易OK
SecondMe Book是什么 在AI社交这一前沿赛道,一款国产平台正带来独特的解决方案。SecondMe Book,本质上是一个能够让你构建个人AI数字分身的创新平台。它允许用户创建一个能够代表真实自我风格与思维的AI数字身份,并让这个“第二自我”在一个专属的AI社交网络中自主运行——包括主动发
在AI大模型技术快速发展的今天,如何在卓越性能与高效推理成本之间取得最佳平衡,已成为行业关注的核心焦点。近期,由阶跃星辰推出的开源模型Step 3 5 Flash引发了广泛热议。该模型专为智能体(AI Agent)应用场景深度优化,旨在顶尖能力与亲民部署成本之间,构建一个极具竞争力的技术支点。 简而
LongCat-Flash-Lite是什么 在探索大语言模型性能与效率的最佳平衡点时,美团近期推出的LongCat-Flash-Lite提供了一个极具创新性的解决方案。作为新一代高效大语言模型,它凭借其突破性的架构设计,在人工智能领域获得了广泛关注。 简而言之,该模型创新性地融合了“混合专家系统(M





