大模型存在一个颇为现实的短板:一旦完成训练并部署上线,其能力基本就处于“冻结”状态。尽管每天处理海量真实请求,模型却很难将新经验有效内化。同一个用户反复纠正的偏好,下一次交互时仍需重新解释;一个智能体在相同流程中屡屡失败,这些失败经历也不会自动转化为它的新技能。要让模型持续进化,最直接的方式是使用新数据重新训练,但面对千亿甚至万亿参数级别的模型,全量重训的成本高得令人望而却步,根本无法频繁进行。

近日,Mind Lab 开源的 Macaron-V1 正是针对这一痛点而来:冻结庞大的基座模型,仅训练一个极小的附加模块,借助强化学习将新经验持续写入参数,使大模型在部署后依然能够以低成本实现持续学习。
一、Mind Lab 最新开源了 Macaron-V1
打造 Macaron-V1 的团队来自 Mindverse 旗下的研究实验室 Mind Lab,他们在智能体领域并非新手。早在 2023 年,团队中的 Andrew 便与现任腾讯集团首席 AI 科学家姚顺雨、普林斯顿大学的 Karthik Narasimhan 合作推出了 FireAct,通过监督微调将智能体的行为轨迹写入模型参数,这堪称“将经验写入参数”这一思路的早期探索之一。
从 FireAct 到 Macaron-V1,这条技术路线一脉相承:当年用监督微调一次性写入,如今则改用强化学习持续写入。Mind Lab 沿着这一方向将其推进至万亿参数规模。根据公开报道,全球能够在万亿参数级别上成功运行 LoRA 强化学习的团队屈指可数,他们便是其中之一,另一家则是前 OpenAI CTO Mira Murati 创立、估值已超一百多亿美元的 Thinking Machines Lab。
此次发布的 Macaron-V1 本身是一个面向个人智能体场景的开源模型,提供两个版本:旗舰版 Venti,拥有 7480 亿参数,由一个 744B 的 GLM-5.2 基座加上四个 10 亿参数的 LoRA 专家组成,原生支持 200 万 token 上下文;轻量版 Tall,拥有 350 亿参数,基于通义千问 3.6,专为本地部署设计。此外,此前还有一个预览版 Macaron-V1-Preview,参数规模为 749B、配备五个专家,后续我们会提及两代之间的差异。

一、Macaron-V1核心思路:不重训整个模型,也能让它持续学习
让模型实现持续学习,其实存在两条截然不同的路径。
一条路径是不改动参数,将经验直接放入上下文,比如提示词、记忆、检索以及外部技能等都属于此类。这条路径的优势在于灵活,但经验存储在模型之外,每次使用都需要重新读取,随着积累越来越多,成本也随之攀升。更重要的是,将信息放入上下文,并不等同于模型真正“学会”了,其能力上限仍然受限于模型自身的理解力。另一条路径则是将经验写入参数,让模型直接内化,面对相似任务时无需每次都重新读取全部历史记录。Macaron-V1 选择的是后者。
全量更新整个模型的代价过高,因此具体实现采用了低秩适配技术,即 LoRA:在冻结的基座模型旁挂载一个参数量极小的可训练模块,其规模不足基座的百分之一,训练时仅更新这一小模块。LoRA 在这一技术路线中的角色发生了根本性转变。过去,它大多被视为节省显存、能力有所打折的廉价替代方案,是资源不足时对全量微调的妥协。而在这条新路线中,它被重新定义为一款承载个性、不断演化的持久状态——一个会随交互持续变化的记忆体。基座提供通用能力,小模块则负责承载特定场景下的偏好、技能与工具使用习惯。
将经验转化为训练信号这一步,则通过强化学习来实现:模型执行任务、获得结果,再根据结果的优劣来调整小模块的参数。这恰好衔接了前文提及的 FireAct 研究脉络。FireAct 当年采用监督微调,将现成的轨迹一次性写入参数。而这条路线将其替换为强化学习,让模型在部署后仍能持续从自身经验中学习,而非学一次就止步不前。
Macaron-V1 的架构正是这一思路的直接落地,它被称为 Mixture-of-LoRA。在冻结的 GLM-5.2 基座上,它挂载了四个各含 10 亿参数的 LoRA 专家,各自负责不同环节:
L0 Chat,负责对话交互与指令遵循;
L1 Agent,负责长程、动态且复杂的智能体任务;
L2 Coding,负责代码理解、软件工程与终端操作;
L3 UI,负责界面渲染与界面驱动的交互操作。
新能力以插件式的 LoRA 形式加入,不会干扰已有知识,不同专家还能在同一基座上灵活组合。

为了亲自验证他们训练出的模型效果,我们在 Claude Code 上配置了 Macaron-V1-Venti,让它执行一个 3D 世界生成任务。仅给出一句提示,十几分钟后便获得了一个双击即可运行的 3D 网页——一个完整的巧克力工厂微缩世界。
提示词只有这一句:
「用 Three.js 从零造一个巧克力工厂花园世界:巧克力河、焦糖瀑布、糖果园、传送带、微缩工人,全部程序化生成,不许用外部素材,工人还要有真实的任务队列和路径网络」。

它生成出的世界是这样的:黄昏下的糖果小镇,工厂烟囱冒着烟,摩天轮缓缓转动,六个小人沿着路网各自领取任务、搬运糖料、照看篝火,而不是仅仅站在那里摆拍。没有补充任何额外提示,也没有喂入任何素材,这一切都是它从那一句话中自主生成的。


这套产出,是在冻结的基座上仅训练了一小部分 LoRA 参数所取得的成果。训练只动了极小一部分,但效果依然令人印象深刻。至于这种“只训一小部分”能节省多少成本、在多大参数规模的模型上仍然成立,正是下一节要详细说明的内容。
二、低成本的底气:万亿参数上,算力只要约十分之一
LoRA 本身并非新技术,早期主要用于低成本的监督微调。但它能否胜任强化学习这种更复杂的训练方式,此前学界一直未有定论。
这个问题的科学结论,最早由 Thinking Machines Lab 在 2025 年的研究中给出:只要 LoRA 覆盖到包含前馈层和专家层在内的所有层,且不超过其容量,它在监督微调和强化学习上都能达到与全参数微调相当的水平,并且强化学习对秩的要求还更低。这项研究为这条路线奠定了科学基础,而 Mind Lab 则将其进一步推向了万亿规模。在他们公开的研究中,团队在万亿参数的稀疏专家模型 Kimi K2(总参数约 1.04 万亿、单次激活约 326 亿)上端到端地跑通了 LoRA 强化学习,算力开销约为全参数强化学习的十分之一,训练曲线平稳上升,未出现灾难性发散。他们还发现,即使将可训练模块压缩到极低的秩,仍能保持稳定训练,只需搭配一套专门的初始化方法即可。

这条路线的一部分证据还可以从外部进行核实,不必仅依赖官方数据:相关训练框架的补丁已并入多个主流开源训练项目的上游,配套基础设施也已以 verl-mint 的名字开源。
对 Macaron-V1 而言,正是这套“在万亿基座上做强化学习也仅需十分之一算力”的能力,才让持续更新从一项偶尔为之的重活,变成了一项可以频繁执行的常规操作。将成本压到如此之低,除了让持续学习变得可行,还打开了另一种新的可能性。
三、成本够低,一个基座就能长出一群会协作的小模块
正因为写入一次经验的成本被压到如此之低,同一个基座上能挂载的就不止一个模块。多个小模块分别学习不同的能力,再让它们相互协作,整体能力还能再上一个台阶,这便是群体智能的体现。

Mind Lab 曾进行过一组对照实验来验证这一想法。他们从同一个约 300 亿参数的开源模型(Qwen3-30B)出发,仅改变数据顺序和训练细节,训练出近两百个小模块,并在数学基准 AIME24 上进行了多数投票。单个模块的准确率为 36.4%,而 198 个模块一起投票后,准确率提升至 48.7%,明显高于对同一模块反复采样所能达到的上限(约 43.3%),也高于基线的 37.3%。这组数字来自受控实验,验证的是“多个模块协作确实能更强”这一规律,并非 Macaron-V1 本身的成绩。

Macaron 的模型正是这一思路的产品化体现。它有两代版本:预览版 Preview 是 749B 配备五个专家,正式版 Venti 是 748B 配备四个专家,从五到四并非缩水,而是将 Preview 中与特定场景相关的一个 LoRA 合并进了通用的 Agent 专家(两代演进的具体细节以官方口径为准)。支撑这一切的是一套名为 MinT 的基础设施,它将海量小模块的训练、评估、部署、回滚统一管理起来,设计目标是能够管理百万量级的模块目录。有了这一层工程底座,模块规模再大也能有序训练、部署和更新,群体智能才真正得以落地。

写在最后
用 LoRA 承载个性、用强化学习将经验持续写入参数,再通过一套基础设施将海量小模块管理起来,Macaron-V1 为“让大模型部署后还能持续学习”提供了一条完整且低成本的实现路径,关键环节均有公开研究和开源代码作为支撑。
持续学习这一方向本身仍存在几个公认的难点:在模糊反馈下如何稳定地获取可靠的学习信号、不断写入新经验时如何避免覆盖旧能力、大量模块的多样性如何真正转化为群体层面的能力。这些都是整个领域正在努力解决的问题,而 Macaron-V1 是目前最完整的一次公开答卷。
对从业者而言,这条路线有几点值得借鉴:将适配模块视为可训练的持久状态,而不仅仅是节省显存的技巧;与其将一个模型无限做大,不如让多个专门的小模块分工协作;将模块的版本管理、评估、回滚作为基础设施来建设。
据悉,近期 DeepSeek 创始人梁文锋也提到,AI 现在不缺品味和直觉,缺的是持续学习的能力,能让模型持续学习才算得上下一代模型。这与 Mind Lab 的判断不谋而合。在他们看来,下一代智能的决定性因素不再是将单一模型越做越大,而是两件事:通过递归自我改进进行后训练,让模型持续从经验中学习;以及多智能体协作,让专业化模型在共享基础设施上组合。Macaron-V1,正是迈向这一方向的一个重要里程碑。
