游乐游手机版
首页/AI热点日报/热点详情

字节跳动Seed开源VeOmni框架 解锁任意模态模型训练

类型:热点整理2026-07-21
字节跳动Seed团队开源VeOmni框架,以模型为中心解耦分布式并行与模型计算,降低全模态训练工程开销。300亿参数MoE模型在128卡上吞吐量超2800tokens sec GPU,支持160K超长上下文,训练启动仅需一天,工程耗时压缩90%以上。

全模态大模型需要同时具备图像理解、语音识别和内容生成的能力,其背后的训练工程挑战极为复杂。字节跳动 Seed 团队近期开源了 VeOmni 框架,旨在将这一繁琐的训练流程变得像搭积木一样灵活便捷。

首先,几个核心判断:在多模态模型架构仍在快速迭代的当下,框架的通用性和灵活性比针对单一场景的极致性能优化更为关键。VeOmni 正是基于这一理念,提出“以模型为中心”的设计思路,将分布式并行逻辑与模型计算解耦,大幅降低工程开发成本。实测数据显示,一个 300 亿参数的全模态 MoE 模型,在 128 张 GPU 上训练时,吞吐量可超过 2800 tokens/sec/GPU,并且能轻松扩展到 160K 的超长上下文序列。

解锁任意模态模型训练,字节跳动Seed开源VeOmni框架

值得一提的是,使用 VeOmni 框架,从模型代码构建到训练任务启动仅需一天,相比传统框架动辄一周以上的工程研发时间,工程耗时压缩了 90% 以上。目前,VeOmni 的相关论文和代码仓库均已公开。

全模态大模型训练面临的挑战

全模态能力背后,是日益复杂的模型架构。一个典型的全模态理解与生成统一模型,通常以语言模型为核心,外接多种模态专属的编码器和解码器,共同处理连续或离散的图像、音频等信号。

问题在于,直接将现有训练框架应用于这类模型并不顺利。以 Megatron-LM 为代表的常用框架,大多专为纯文本大语言模型设计。这些框架采用“以系统为中心”的思路,将模型定义与并行逻辑(如张量并行、流水线并行)紧密耦合,适合结构规整的文本模型。一旦遇到结构复杂、模态多样的全模态模型,就容易出现负载不均、扩展性差等问题。

更关键的是,这种“耦合”设计带来了巨大的工程开销。当团队需要引入新模态或调整模型结构时,往往必须深入底层,重写大量分布式代码。算法研究团队也因此不得不与工程团队紧密绑定,无法快速独立验证想法。

虽然新一代的 PyTorch 原生训练框架(如 TorchTitan)能够降低工程复杂度,但它们更多聚焦于分布式系统设计本身,对多模态模型缺乏针对性支持。对于更复杂的“任意模态到任意模态”场景,业内此前确实缺少一个成熟、可扩展的工业级分布式训练解决方案。

VeOmni 核心设计:以模型为中心的分布式训练方案

正是为了应对这些挑战,VeOmni 提出了“以模型为中心”的设计思路。

在系统设计中,通用性与高性能之间往往需要权衡。针对特定场景的深度优化可以大幅提升性能,但会牺牲框架的灵活性。而在全模态领域,模型架构仍在快速演进,不同模态的计算负载极不均衡——这意味着,当前阶段框架的通用性和对创新的支持能力,其重要性远超对单一场景的极致性能压榨。

因此,VeOmni 的设计理念非常明确:在确保通用性的前提下追求高性能,让系统去适配快速变化的模型,而不是让模型去迎合固化的系统。

VeOmni 将模型定义与底层分布式训练代码解耦,使得 FSDP、SP、EP 等分布式策略可以灵活组合应用于不同的模型组件(如编码器、MoE 层),无需修改模型代码本身。同时,它还提供轻量级接口,支持新模态无缝集成。

如下图所示,左侧是现有训练框架,通信操作与计算操作深度耦合,穿插在模型代码的各个角落;右侧是 VeOmni 架构,其内部子模型是纯粹的“计算模块”,所有分布式通信逻辑由框架统一处理。

“即插即用”的全模态接口

为了让增加新模态变得轻松,VeOmni 设计了一套轻量级的全模态模型接口。任何模态的编解码器只需遵循统一、轻量级的 HuggingFace 接口规范(例如实现 lm_encode、lm_generate 等函数),即可快速接入。研究者可以快速、方便地在 LLM 基础上扩展任意模态,或切换各个独立子模块的模型结构。

“化繁为简”的 n-D 并行与统一调度

VeOmni 的另一大特点是“可组合性”。在解耦分布式代码和模型代码的同时,所有并行策略(FSDP、SP、EP)都可以像积木一样,被自由地应用到模型的不同组件上。例如,可以对视觉编码器使用 FSDP,同时对语言模型中的注意力部分使用 HSDP+SP、MoE 部分使用 FSDP+EP+SP。

为了实现这种灵活的分布式组合,VeOmni 基于 DeviceMesh 设计了统一分布式抽象层 parallel_state 来控制所有并行维度,极大简化了 n-D 并行的管理复杂度,同时也提高了可扩展性。

  • 数据并行策略

VeOmni 集成了完全分片数据并行(FSDP)策略,其非侵入式设计适合训练结构不固定的全模态大语言模型,与 VeOmni 的设计理念一致。为进一步优化超大规模集群性能,VeOmni 还支持混合分片数据并行(HSDP)策略,利用 2D 设备网格,在节点内使用 FSDP,在节点间使用分布式数据并行,大幅减少昂贵的跨节点通信。最方便的是,从 FSDP 切换到 HSDP,用户只需在配置中更改一个 data_shard_size 参数。

bash train.sh tasks/train_torch.py \
    --train.data_shard_size 8
  • 序列并行,支持超长序列

全模态模型需要处理高清图像、长视频、长音频等内容,对超长上下文窗口的支持至关重要。VeOmni 采用了 DeepSpeed Ulysses 序列并行技术,并进一步实现了 Async-Ulysses。通过将耗时的 All-to-All 通信操作与 Attention 中的线性投射计算并发执行,实现计算通信重叠,保证了在超长序列下的高效率训练和可扩展性。同样,为坚持“以模型为中心”的设计,VeOmni 设计了一个极其简单的分布式 flash_attention_forward 接口,可以在模型层面不引入任何分布式代码,实现高效序列并行。

  • 专家并行,高效扩展 MoE 模型

对于混合专家模型(MoE)的专家并行,VeOmni 设计了一个基于 torch DTensor 的 ParallelPlan 接口。只需指定对应参数的切分维度,并在训练时指定 expert_parallel_size,即可完成专家并行切分逻辑。

  • 灵活的算子级通信优化方法

在 MoE 模型训练中,All-to-All 通信将 Tokens 路由到不同设备上的“专家”处,需大量通讯开销。业界主流此前常用的流水线并行调度方案,在多模态模型训练这种负载多变的场景中,显得“僵化”且“不灵活”,容易引入更多气泡,造成计算资源浪费。VeOmni 采用 Seed 团队研发的 COMET 细粒度计算-通信重叠技术,其通信优化效果与模型结构大小无关,更适合全模态的 MoE 模型训练。

  • 全方位的系统级优化

除了核心的分布式优化,VeOmni 还集成了动态批处理 (Dynamic Batching)、高效算子、重计算和内存优化、高效的检查点读写系统 ByteCheckpoint 等一系列优化,全方位提升训练效率和稳定性。

VeOmni 实验结果:支持超长序列,全模态训练更高效

在 8 到 128 卡的 GPU 集群上,我们基于业界主流的开源模型,对 VeOmni 的性能进行了系统性评测。

较好地支持超长序列训练

在处理高清图像和视频时,模型需要支持极长上下文序列窗口,这对显存和计算效率是巨大考验。VeOmni 通过应用序列并行技术,能够较好应对这一挑战。面向 7B 的开源多模态理解模型,VeOmni 可支持的序列长度高达 192K,进一步扩展 SP 大小,还能进一步扩展。面向 72B 参数量的更大模型,VeOmni 也能支持到 96K

3D 并行策略提供更好的训练效率

对于当前主流的 MoE 架构,VeOmni 通过 3D 并行策略(FSDP+SP+EP)实现了更好的训练效率。在支持语音理解、视觉理解与生成的全模态 30B MoE 模型上,VeOmni 不仅能适配 160K 超长序列,还能保持很高的训练吞吐量。

文本模型训练超越 TorchTitan

为了更客观地评估 VeOmni 的性能,我们还在纯文本模型上,对 VeOmni 与业界先进的 TorchTitan 框架进行了详细的基准测试。结果显示,从 7B 到 72B 参数量级,VeOmni 的吞吐量、内存效率均稳定优于 TorchTitan。尤其在长序列场景,VeOmni 凭借更优的内存管理和并行策略展现出更明显的优势。

训练稳定收敛

除效率和可扩展性,训练稳定性也至关重要。我们使用 VeOmni “即插即用”的全模态接口构建了三款架构各异的全模态大模型,并在包含文本、图片、音频、视频的复杂任务上进行训练。结果显示,所有模型均可以稳定收敛,证明了框架的鲁棒性和在真实训练场景中的有效性。

真实训练实践

除了在实验中展现出不错性能,VeOmni 已应用于字节跳动 Seed 团队的多个前沿项目中。比如,多模态智能体 UI-TARS-1.5 在训练中使用了大量长序列(>128k)、多模态的 Agent 数据,依托 VeOmni 强大的序列并行能力,团队成功解决了超长序列带来的显存瓶颈问题,实现了高效的模型训练。

总结与展望

VeOmni 的开源,旨在为 AI 社区提供一个高效、灵活、易用的任意模态模型训练解决方案。通过以模型为中心的设计理念,它将模型与系统解耦,降低了全模态 AI 训练的工程壁垒,让研究者可以更专注于模型和算法本身的创新。

未来,VeOmni 框架还将进一步完善,支持更多不同架构、规模的多模态模型训练需求,并持续向社区分享前沿的模型训练技术。

来源:https://www.53ai.com/news/LargeLanguageModel/2025081438692.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。