游乐游手机版
首页/AI热点日报/热点详情

黑森林实验室正式发布全新FLUX 3多模态基础模型

类型:热点整理2026-07-24
FLUX3是BlackForestLabs推出的多模态基础模型,基于Self-Flow技术统一生成与理解,支持图像、视频、音频联合生成,一次可输出最长20秒带原生音频的视频,并具备动作预测能力,在机器人操控任务中表现优异。

FLUX 3是什么?多模态AI视频生成模型详解

FLUX 3正式发布,它带来的远不止又一个视频生成模型。Black Forest Labs 此次推出的是一款真正意义上的多模态基础模型——在统一架构下,同时处理图像、视频和音频。其核心依赖 Self-Flow 技术,将生成与理解对齐到同一框架,一次即可生成最长20秒且包含原生音频的视频。此外,它不仅支持文生视频,还涵盖图生视频、视频生视频、关键帧转视频等多种创作方式。更关键的是,模型通过模态间的物理约束学习世界表征,这使得它在机器人操控等任务中表现尤为出色。

FLUX 3的主要功能与能力

具体来看,其功能清单主要包括以下几个方面:

  • 多模态视频生成能力:单次生成最长20秒且自带原生音频的视频,支持文生视频、图生视频(动画延续或视觉参考)、视频生视频、关键帧转视频,以及多语言对话。
  • 统一模态理解与生成:Self-Flow架构将生成和理解对齐到底层框架,图像、视频、音频可联合生成,输入既可以是纯文本,也可以是参考图像或视频。
  • 智能片段串联:多个独立片段能智能拼接为更长的多镜头序列,风格覆盖手持实录、动画、电影级等多种类型。
  • 可扩展动作预测:架构中预留了Action编码器/解码器扩展位,原生支持物理AI和机器人控制任务,后续发展潜力巨大。

FLUX 3的技术原理与架构

从技术层面看,它究竟是如何实现的?

  • Self-Flow 自对齐架构:在Flow Matching基础上引入自对齐机制,将多模态生成与理解统一到同一框架,既提升了生成质量,也增强了世界理解能力。
  • 多模态 Transformer:文本、图像、视频、音频分别经过独立编码器处理,然后汇入统一的Transformer,模态间信息交互融合,最后通过对应解码器输出。
  • 联合训练范式:同步加大计算与数据投入,对视频、图像、音频进行联合训练,利用模态间的物理约束学习更准确的世界模型。
  • 模态互约束学习:声音需匹配冲击力,运动需遵守物理质量,未来画面需遵循过去逻辑。通过多模态联合约束,模型构建起对物理世界的统一表征。

如何使用FLUX 3

想要上手体验?操作流程非常简单:

  • 获取访问权限:直接访问Black Forest Labs官网(https://bfl.ai/)申请Early Access早期体验资格。
  • 选择使用方式:可通过浏览器Playground直接体验,也可通过API或第三方平台(Replicate、fal.ai、Together AI)集成调用。
  • 输入创作指令:在Playground或API中输入文本提示,或上传参考图像/视频作为创作输入。
  • 配置生成参数:选择目标模态(图像/视频/音频)、设定风格、宽高比、输出时长等参数。
  • 获取生成结果:模型自动完成多模态生成,随后即可下载或集成输出的图像、带音频的视频等内容。

FLUX 3的核心优势

与同类产品相比,FLUX 3的核心优势体现在以下几个关键方面:

  • 生成与理解双提升:Self-Flow架构统一了生成与理解,机器人操控任务成功率高达47%,且学习速度是传统Flow Matching的2倍。
  • 用户偏好领先:在720p带音频视频的盲测中,对Runway Gen-4.5的偏好率为77%,对Luma Ray 3.2更是达到93%。
  • 原生音频视频联合生成:单次可生成长达20秒且带原生音频的视频,无需后期配音,声画同步自然流畅。
  • 统一多模态架构:图像、视频、音频在统一框架下联合训练,模态间的物理约束使世界模型更加精准。
  • 风格多样性:从手持实录到动画、电影级,风格覆盖广泛,还支持强排版生成与动态设计。
  • 可扩展至物理AI:架构预留了Action编码器/解码器,原生支持机器人控制等物理世界交互任务。

FLUX 3的项目地址

  • 项目官网:https://bfl.ai/blog/flux-3

FLUX 3的同类竞品对比

将它与Seedance 2.0进行简单对比,可以更直观地了解其优势:

从模态覆盖来看,FLUX 3覆盖图像、视频、音频和动作预测,且采用统一架构;Seedance 2.0则支持文本、图像、视频、音频四模态输入。单次生成时长方面,FLUX 3最长可达20秒带音频视频,Seedance 2.0未明确说明。用户偏好率方面,两者持平,均为52%。架构上,FLUX 3采用Self-Flow统一生成与理解,Seedance 2.0则使用Universal Reference系统。动作预测方面,FLUX 3原生支持且架构预留了位置,Seedance 2.0未提及。开源策略上,FLUX 3提供Open Weights,Seedance 2.0为闭源API。

FLUX 3的应用场景

最后,如此强大的能力可以应用于哪些领域?

  • 影视预演与广告创意:快速生成带音频的视频分镜与动态概念片,大幅降低前期制作成本。
  • 多模态内容创作:一键产出风格统一的图文音视频素材,适用于社交媒体与营销传播场景。
  • 虚拟角色与动画:基于参考图像保持角色一致性,跨场景生成连贯的动画视频。
  • 物理AI与机器人:利用动作预测能力训练机器人操控策略,加速具身智能研发。
  • 动态设计与排版:生成强文字排版与动画设计内容,适用于品牌视觉与数字广告。
来源:https://ai-bot.cn/flux-3/

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。