Sora,这个由OpenAI在2024年2月(美国当地时间)正式对外发布的文生视频大模型,背后其实藏着更大的野心——OpenAI并没有把它简单定义为“视频生成工具”,而是称之为“世界模拟器”。名字也很有意思,Sora在日语中是“天空”(そら)的意思,引申开来就是“自由”,倒也贴切地呼应了它那种近乎无限的创造潜力。

那么,这个模型到底能做什么?简单说,你给它一段文字描述,它就能生成最长60秒的逼真视频。更关键的是,Sora不只是“画”出画面——它真正理解物体在物理世界中的存在方式,能够深度模拟真实世界的动态。比如生成多个角色同时互动的复杂场景,或者让物体按照物理规律运动,这些都不是简单的像素堆砌能实现的。从画质到指令跟随能力,它都继承了DALL·E 3的水准,用户提出的要求它能精准理解并呈现。
对于需要制作视频的艺术家、电影制片人甚至学生来说,Sora带来的可能性是碘伏性的。OpenAI自己也将它视为“教AI理解和模拟运动中的物理世界”这一长期计划的关键一步。换句话说,Sora的出现,标志着人工智能在理解真实世界场景并与之互动这件事上,确实迈出了一大步——这不只是技术迭代,而是范式层面的飞跃。
