游乐游手机版
首页/AI热点日报/热点详情

小红书开源BigMac,多模态训练显存速度双解放

类型:热点整理2026-07-24
小红书开源BigMac流水并行训练范式,通过将编码器与生成器计算嵌入LLM调度间隙,打破显存与速度的帕累托前沿。相比现有方案,显存降至O(1)且无空泡,训练速度提升1 1-1 9倍,峰值显存稳定,已应用于生产环境。

多模态大语言模型正在成为新一代人工智能的底层基石,这几乎已经是行业共识。但说到它的训练系统,一个老问题始终如影随形——算力利用率高的方案,显存压力巨大;而显存占用低的设计,又往往拖慢整体训练速度。这就像是一个老生常谈的“鱼与熊掌”问题。小红书 dots infra 团队把这个困境定义为“多模态流水训练中的帕累托前沿”,而如今,他们成功在这一前沿撕开了一道突破口。7月22日,团队正式开源了全新的流水并行训练范式 BigMac,专为原生多模态训练场景定制,项目代码已发布于 GitHub 的 Dots-Infra 仓库。

多模态模型从来不是一块整齐划一的 Transformer。典型的多模态大语言模型(MLLM)由三大组件拼接而成:负责将图像、音频等输入映射为 embedding 的模态编码器,承载核心推理能力的LLM 主干网络,以及将 LLM 输出重新投射至图像、语音等目标模态的生成器。这三者在计算特性、延迟分布与内存行为上差异巨大,强行塞入同一条传统流水线,自然引发连锁问题。

当前业界主流做法大致分为两类,各有各的短板:

第一类追求计算效率最大化——将编码器与生成器从主 LLM 流水线中剥离,独立调度。优势在于模态模块的耗时抖动不会在 LLM 流水线中引发空泡(bubble),但代价是激活显存随 microbatch 数量线性增长,在大规模训练中尤为昂贵。

第二类侧重显存效率优先——把全部模块统一纳入单条流水线,首尾阶段严格对齐。虽能压缩激活生命周期、降低峰值显存,但只要任一编码器或生成器响应稍慢,整条 LLM 流水线便被迫停滞,“尾部空泡”随之产生。

当模型与数据规模扩大,两种路径的瓶颈均会迅速暴露。这不禁让人思考:有没有一种办法,能让两者不再互相掣肘?

BigMac 的设计起点简洁却极具穿透力:LLM 流水线本身,仍是不可动摇的调度主干。大规模 LLM 训练早已深度依赖如 1F1B 或 interlea ved 1F1B 这类高度工程化的调度策略,它们与生产级训练栈高度耦合。BigMac 并不试图推翻这套成熟机制,而是将其作为底层时间轴,再将编码器与生成器的计算任务,精准嵌入到“输入已就绪、且不干扰 LLM 执行顺序”的间隙中。团队将该架构命名为准依赖安全的嵌套流水线(Quasi-Dependency-Safe Nested Pipeline)

这一设计带来了两大关键性质:

其一,编码器与生成器的执行波动不再沿 LLM 流水线逐级传导,LLM 依然按既定节奏稳定推进;

其二,模态相关激活显存被算法层面压缩至 O(1) ——编码器无需为所有 microbatch 持续保留激活直至流水结束,生成器也不必拖着冗长的激活链。

说白了,BigMac 并非在显存与空泡之间做权衡取舍,而是通过重构调度结构,使二者不再互斥。这才是关键所在。

从理论可调度,到真正落地可训,中间横亘着系统集成、接口抽象、性能调优等一系列工程挑战。BigMac 正是为此而来,它交付了三样关键能力:

第一,全局可观察的调度视图:运行时 Scheduler 会生成一张覆盖所有 pipeline rank、microbatch 及模块类型的全局 operator 表,Executor 再据此拆解为各 rank 上的本地执行序列,并分发至 Megatron Core 等 LLM 后端、模态 runtime 与通信后端。调度逻辑从此透明、可验证,同时保持对下游后端的高度兼容性。

第二,面向算法工程师的零感知流水接口:开发者只需声明每个模块的输入输出依赖关系(即“生产什么、消费什么”),其余诸如 stage 划分、activation/gradient 交接、跨设备通信等复杂细节,均由 BigMac 在底层自动完成。这意味着,一个在单卡上验证通过的多模态实验,能平滑扩展至大规模流水并行环境。

第三,深度理解调度结构的工具链:包含 profiler、simulator 与可视化模块,可将一次训练迭代精确还原至 operator 级别,清晰呈现每个 rank 在每个时刻的计算状态、空转位置及阻塞依赖;simulator 更支持在真实训练启动前,快速试跑不同 PP 配置与 microbatch 组合,预估其对空泡率与吞吐的影响。

实际效果已在两类典型负载中得到验证:

MLLM-Understanding 场景中,以 Qwen3-30B-A3B 为主干、搭配 1.3B ViT 编码器,BigMac 相比计算高效基线 Optimus 提速 1.08–1.1 倍,相较显存高效基线 Megatron-DistTrain 提速达 1.6–1.9 倍;更关键的是显存表现——随着 per-GPU batch size 增大,BigMac 的峰值显存维持平稳,而 Optimus 因需全程保留编码器激活,显存持续攀升,最终在更大 batch 下直接 OOM。

在更复杂的 MLLM-Generation 场景中,引入 20B 规模的 MMDiT 生成器后,差异进一步放大:Optimus 在所有测试 batch size 下均触发 OOM;BigMac 则通过及时触发 generator backward、快速释放生成侧激活,成功规避内存危机,相比 Megatron-DistTrain 仍实现 1.5–1.9 倍加速,显存曲线同样稳健。这正是嵌套流水线最具价值的战场——系统必须同时满足编码器与生成器的复杂依赖,又无法容忍大量激活驻留或严重空泡。

目前,BigMac 已作为 dots 多模态模型训练体系的核心组件之一,稳定运行于小红书生产环境。相关论文《BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training》已上线 arXiv,团队同步公开了交互式 PP Profiler 的 trace 示例。对于正被多模态训练中显存与速度双重挤压的研究者与工程师而言,这份经过真实业务锤炼的开源方案,或许能大幅节省重复造轮的时间成本。

来源:https://www.php.cn/faq/2870952.html?uid=1246273

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。