游乐游手机版
首页/AI热点日报/热点详情

微信强化学习大模型训练库YATT完全实战指南

类型:热点整理2026-07-21
微信团队开源WeChat-YATT大模型训练库,针对强化学习与多模态场景,基于Megatron-Core和SGLang vLLM。采用ParallelController缓解内存瓶颈,通过全员共存与部分共存模式提升资源利用率。在GenRM任务中,训练时间较VeRL缩短约60%。

微信团队最近开源了一个名为 WeChat-YATT(YATT, Yet Another Transformer Trainer,内部项目名 gCore)的大模型训练库。这个库专门针对强化学习和多模态模型的训练场景,核心目标就四个字:易扩展、简洁、高效、可靠。它基于 Megatron-Core 和 SGLang/vLLM 研发,通过定制化的并行计算策略,能较好地处理大尺寸模型、长序列输入和大数据集——这些在微信内部的多个实际业务中已经得到了验证,训练效率的提升相当明显。

那么,这个训练库到底解决了哪些具体问题?或者说,它为什么值得关注?

WeChat-YATT:微信强化学习大模型训练库

项目背景

大模型分布式训练中,有两个痛点长期困扰着工程团队:

痛点一:多模态场景下的可扩展性瓶颈。当图像、视频这类多模态数据规模不断增长时,传统架构依赖一个 SingleController 来管理所有数据,结果通讯和内存很容易变成瓶颈。系统吞吐量上不去,训练流程还动不动就异常中断。WeChat‑YATT 的思路很直接——引入 Parallel Controller 并行管理机制,把压力分散到多个控制器上,系统的可扩展性和稳定性一下子就提起来了。

痛点二:动态采样与生成式奖励下的效率短板。在需要频繁动态采样或生成式奖励计算(GenRM)的训练流程中,模型频繁切换加上“长尾”任务,会产生大量额外开销,GPU 算力根本吃不饱。WeChat‑YATT 采用部分共存策略和异步交互,大幅减轻模型切换损耗,同时抑制长尾任务的影响,实现了高吞吐量和高资源利用率——这对大规模 RLHF 任务的高效迭代来说,是实实在在的推动。

架构介绍

针对不同的业务场景,WeChat‑YATT 提供了两种资源放置模式:全员共存与部分共存。目的很明确——最大化集群的资源利用率。配合灵活的调度策略,这套方案能适应各种训练需求和计算环境。

同时,WeChat‑YATT 采用 Parallel Controller 模式,多个 Controller 协同管理数据任务,单节点的内存压力显著降低。尤其在多模态训练场景下,这种架构比传统的 Single Controller 更可靠。

● 全员共存模式。采用串行调度机制,Actor Rollouts、GenRM(Generative Reward Model)与 Train 依次串行执行。每个角色完成任务后主动释放计算资源,系统加载下一个任务所需模型。这种策略适配绝大多数常规训练场景。值得一提的是,在每个阶段,相关组件都可以独占全部 GPU 资源,这极大缩短了资源空闲的“气泡”时间,整体训练吞吐量和效率自然就上去了。

● 部分共存模式。在此模式下,Actor Rollouts 与 GenRM 独立部署,通过异步方式进行高效交互。Actor 训练阶段会占用全部 GPU 资源;到了 Rollouts 生成阶段,Actor 释放 GPU 资源,唤醒 Actor Rollouts 及 GenRM 两大组件协同工作。系统通过动态负载评估进行资源分配与均衡。当 Rollouts 生成完毕,这两者释放资源,Actor 重新加载到 GPU 上,进入下一轮训练。部分共存模式非常适合 Rollouts 与 GenRM 需要高频交互、动态采样的任务场景。

多元的资源放置模式加上灵活的调度机制,让 WeChat‑YATT 在复杂多变的实际环境下都能实现资源的高效利用,助力大模型在微信内部多个场景的应用落地。

项目特点

高效内存利用:利用 Parallel Controller,有效降低单节点内存消耗,更适合多模态场景下的大模型训练,扩展性和稳定性都有保障。

GenRM 高效支持:针对 GenRM 场景实现了不同的资源放置策略,使用者可以根据场景选择最高效的方案。

智能 Checkpoint 策略:支持异步 Checkpoint 保存,并且针对微信业务场景,会根据调度流程自动断点保存,训练安全性和高可用性都得到了加强。

负载均衡优化:训练过程中,各数据并行组之间实现了负载均衡,有效减少资源空闲时间,整体训练吞吐量显著提升。

实验效果

图1.随着训练进行训练时间的变化

图2.训练过程中每个阶段的用时

在 GenRM 任务场景下,我们将 WeChat‑YATT 与开源训练框架 VeRL 进行了实验对比。WeChat‑YATT 采用全员共存架构,在给定 GPU 数量的前提下,其他实验参数严格按相关论文设置。结果如图1所示:WeChat‑YATT 相比 VeRL,整体平均训练时间缩短约 60%

训练效率的大幅提升,主要归功于 WeChat‑YATT 独特的全员共存架构——所有关键组件能够高效共享计算资源,每个角色在其所处阶段都能充分利用全部硬件算力,资源使用率极高。再看图2的分阶段耗时分解,WeChat‑YATT 在各阶段的训练速度均比 VeRL 快 50% 以上。相比之下,VeRL 采用外置 GenRM 策略,在除 GenRM reward 阶段之外,GenRM 所占据的资源完全空闲,计算资源利用效率自然就低了。

综合来看,WeChat‑YATT 在 GenRM 场景下展现出了卓越的训练效率,为复杂任务提供了一个更快速、资源利用更充分的分布式训练方案。

来源:https://www.53ai.com/news/finetuning/2025081820867.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。