围绕Sora究竟能否理解物理世界——这一话题近期在业内被频繁热议,甚至衍生出更极端的争论:Sora到底更像一个物理引擎,还是一个世界模型?

坦率地说,Sora目前确实存在一些显而易见的缺陷——比如对左右方向的分辨不够准确,对随时间演变的事件表达也还不够精确。但即便如此,它所生成的视频效果已经足以令人震撼。OpenAI自身也承认存在不少问题,但这些显然都不是阻碍它持续进化的根本性障碍。
行业专家的观点则更具启发性。英伟达高级研究科学家Jim Fan认为,Sora本质上是一个数据驱动的物理引擎,也是一个可学习的模拟器,甚至可以说在某种意义上就是世界模型。然而图灵奖得主Yann LeCun持有截然不同的看法:仅凭提示词生成逼真的视频,并不能证明模型真正掌握了物理规律;视频生成的过程与基于世界模型的因果预测,本质上是两回事。还有观点持折中态度——Sora确实内嵌了物理模型,但问题在于这个物理模型的准确度是否足够?其逻辑推理能力依然存在短板。
无论大牛们如何争论,Sora的能力已经摆在眼前。从精细的场景还原,到生动的角色表情,再到复杂的镜头运动——文本转视频模型已经展现出接近完美的效果。有网友评论道,“首个大型视频生成模型”的称号当之无愧,同时也期待国产大模型能够尽快实现反超。
当然,展望未来,落地应用面临的算力需求也是一大挑战。但这次Sora让所有人看到,AI的能力已经正式拓展到视频领域。市场普遍认为,Sora展示了人工智能在理解真实世界场景并与之交互方面的能力,这被看作是向通用人工智能(AGI)迈出的关键一步。未来,Sora将在更多场景中找到用武之地。
尽管目前Sora尚未对公众开放公测,连内部测试的申请渠道也未公布,但全球的期待值已经拉满。
