游乐游手机版
首页/AI热点日报/热点详情

黑森林实验室发布Flux3 首个原生音频多模态模型20秒音画同步

类型:热点整理2026-07-24
黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构,首个支持原生音频生成,可一次输出20秒音视频同步片段。在720p 10秒测试中,对LumaRay3 2胜率93%,对RunwayGen-4 5胜率77%。与MimicRobotics合作开发机器人动作模型Flux-mimic,已在奥迪工厂测试。Flux3Video已上线,Image与开源版

近日,德国人工智能初创企业黑森林实验室(Black Forest Labs)推出重磅新品——正式发布多模态基础模型 Flux3。该模型采用 Self-Flow 架构,集成了专用图像、视频、音频及动作编解码器,将物理世界与数字环境的统一理解与生成能力融为一体,实现全面整合。

最令人瞩目的亮点在于音视频同步功能。Flux3 是首个支持原生音频生成的多模态模型,一次可输出长达20秒的音视频同步片段,能力涵盖文本、图像、视频转视频、基于关键帧的转场,甚至支持多角色对话。对于大模型而言,将“听得见”与“看得见”整合到同一基础底座,意味着它不再只是图像或视频领域的单一专长——这才是真正的全能型模型。

image.png

早期测试结果同样令人信服。在720p分辨率、10秒片段的设定下,Flux3 以93%的胜率大幅领先 Luma Ray3.2,对 Runway Gen-4.5 也保持了77%的胜率优势;即便面对 Seedance2.0 与 Gemini Omni Flash 等顶尖模型,它依然稳占微弱上风。数据不会说谎,这一表现足够硬核。

更值得关注的是,动作能力已延伸至现实世界。黑森林实验室与 Mimic Robotics 合作,开发了面向机器人领域的动作模型 Flux-mimic,目前已在奥迪工厂开展生产任务测试——多模态能力从屏幕走向了生产线。在发布节奏上,BFL 选择分阶段推进:Flux3 Video 已率先上线,Flux3 Image 与附带开源权重的“Flux3 Dev”也将在近期陆续推出。可以说,每一步都精准踩在关键节点上。

来源:https://news.aibase.com/zh/news/29874

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。