游乐游手机版
首页/AI热点日报/热点详情

黑森林实验室Flux3多模态模型支持20秒原生音视频同步

类型:热点整理2026-07-24
德国黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构,首款原生支持20秒音视频同步生成。性能超越LumaRay3 2等模型,并联合MimicRobotics开发机器人视频动作模型,已在奥迪工厂测试,推动AI向物理世界演进。

7月23日,德国人工智能初创公司黑森林实验室(Black Forest Labs)正式推出了多模态基础模型Flux3,这标志着生成式视频技术迎来了一次真正的跃迁。基于Self-Flow架构打造,该模型配备了专用的图像、视频、音频及动作编解码器,能够对物理与数字环境实现统一的理解与生成——换句话说,它不再只是“看”或“画”,而是开始“听懂”和“动起来”。

QQ20260724-100544.jpg

值得关注的是,Flux3是首款原生支持音频生成的模型,一次性就能输出长达20秒的音视频同步片段。它支持文本/图像/视频转视频、基于关键帧的转场以及多语言对话等功能,覆盖了从创意到生产的多个环节。在720p分辨率、10秒片段的早期测试中,Flux3展现出强劲的竞争力:性能超越Luma Ray3.2(胜率93%)和Runway Gen-4.5(胜率77%),即便与Seedance2.0及Gemini Omni Flash等顶尖模型对标,也保持着微弱优势——这组数据背后,意味着视频生成赛道正在迎来真正的“性能天花板”之争。

此外,公司还联合Mimic Robotics开发了适用于机器人领域的视频动作模型Flux-mimic,目前已在奥迪工厂开展生产任务测试。从实验室到工厂流水线,这个跨度本身就说明了很多。BFL采取了分阶段推出策略:Flux3 Video现已上线,Flux3 Image与开源权重的“Flux3 Dev”也将在近期陆续发布。通过打破单一模态的信息局限,Flux3正加速推动AI向具备感知与行动能力的物理世界演进——也就是业内常说的“世界模型”。

来源:https://news.aibase.com/zh/news/29856

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。