7月24日消息,Black Forest Labs于7月23日正式发布博文,重磅推出其最新产品——Flux 3多模态基础模型,并已通过Early Access方式开放使用。该模型最大的亮点在于:采用统一的架构,将图像、视频与音频三大模态的学习任务融合在一起进行训练,实现了跨模态能力的统一整合。

在训练方面,博文明确指出:该模型基于Self-Flow(自监督流匹配)学习框架进行了扩展,实现了视频、图像与音频的同步训练。这意味着在FLUX.1和FLUX.2系列的基础上,模型的能力边界已直接延伸至多模态生成与理解任务,进一步巩固了统一的生成架构。
那么,FLUX 3究竟能做什么?单次生成即可输出最长20秒的视频,并自带原生音频——这并非简单的画面配乐,而是真正实现了视频与音频的联合生成。支持的玩法涵盖:文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话,以及多镜头串联。一句话概括:从静态到动态,从单模态到多模态,FLUX 3都能轻松驾驭。
性能方面,官方公布了人工评测数据:在带声音的10秒、720p视频对比中,FLUX 3对阵Grok Imagine Video的胜率为69%,对阵Seedance 2.0和Gemini Omni Flash的胜率均为52%。虽然谈不上碾压,但面对多个竞品均能保持超过半数胜率,足以说明这一统一架构的技术路线确实具备竞争力。
值得关注的是,Black Forest Labs还在探索机器人领域的应用。他们正与Mimic Robotics合作,将FLUX 3用作机器人行为预测模型。这相当于把多模态生成能力迁移至物理世界,使模型不仅能“看”和“听”,还能开始“预测行动”,为机器人智能决策提供了新思路。
图像能力同样不容忽视,FLUX 3支持图像生成与编辑,覆盖多种风格、宽高比和分辨率。从官方描述来看,它更像是一个全能的视觉底座,而非偏科生,能够灵活应对多样化的创作需求。
