OpenAI 发布重磅文生视频模型 Sora,首个文本生成视频模型正式亮相

2月16日凌晨,OpenAI 突然亮出王牌——旗下首个文生视频模型 Sora 正式登场。简单来说,用户只需输入一段文字描述,Sora 就能直接生成一段长达60秒的高清视频。没错,整整一分钟,而不是几秒钟的短视频。在文生视频领域,这一突破堪称王炸级别。目前 Sora 模型仅面向部分成员开放,主要用于评估关键领域的潜在危害或风险。
Sora 本质上是一种扩散模型,但与市面上其他模型有所不同——它似乎已经具备了一定的“理解”与“推理”能力。除了根据文本指令生成视频,它还能将一张静态图片直接转为视频,甚至可以对现有视频进行扩展或填充缺失帧。换言之,Sora 的功能覆盖了“文生视频、图生视频、视频扩展”三个方向。更令人惊叹的是细节表现:画面逼真度极高,物理遮挡关系、物体碰撞的轨迹都清晰有序、毫不混乱。
当然,OpenAI 并未隐瞒 Sora 当前的短板。例如,它有时会混淆左右方向,或者难以准确体现随时间推移而发生变化的事件。不过,这些瑕疵在如此级别的技术突破面前,通常只是时间问题,并不会成为真正的障碍。
AI 技术已经正式进入视频生成领域。Sora 的强大能力让整个行业为之震动,业界普遍认为,它展示了人工智能在理解真实世界场景并与之互动方面的能力——这被视为迈向通用人工智能(AGI)的关键一步。未来,Sora 有望在更多应用场景中发挥价值。
值得注意的是,连一向喜欢放狠话的马斯克也忍不住感叹了一句:“人类要认赌服输。”
