过去一个多月,大模型领域再次迎来新一轮技术突破。从GPT-5.5、DeepSeek V4到Claude Opus 4.8,后训练正逐步成为推动模型能力跃升的核心引擎。就在这一关键节点,一家此前鲜为人知的实验室悄然发布了其开源大模型,引发了行业广泛关注。
Mind Lab发布了Macaron-V1-Preview,这是一款拥有749B(744+5B)参数、基于GLM5.1架构、激活参数达40B的模型,专门为Agent Harness场景进行了深度后训练优化。令人惊讶的是,其开发仅用了不到300张GPU——其中大部分并非英伟达最新型号,算力成本仅为同类规模模型训练投入的不到1%。
从最新公布的测试数据来看,这款新模型的表现令人印象深刻,在多个维度展现出强劲竞争力。

Macaron-V1-Preview 在多项评测指标上达到了与头部开源及闭源模型相媲美的水平
在长链路生活任务评测LivingBench与VitaBench中,Macaron-V1-Preview一举夺得最佳性能(SOTA)。在谷歌生成式交互界面A2UI协议的评测以及面向OpenClaw个人智能助理(小龙虾)的PinchBench中,该模型同样取得了开源模型中的SOTA成绩。在数学推理、代码生成等通用任务上,其表现也能与同期头部开源模型并驾齐驱。

Macaron-V1-Preview 在生活场景任务中实现SOTA,在通用Agent任务中达到前沿水准
根据Mind Lab发布的文章,Macaron-V1-Preview首次整合了近期密集更新的LoRA、Agent Harness以及生成式交互Agent to UI(A2UI)等关键技术,天然支持大规模持续学习架构(Mixture-of-LoRA)。这意味着,该模型不仅能进行对话和回答问题,更能深入参与真实任务、调用工具、生成可交互界面,并在长期反馈中实现持续学习与自我优化。
以下是它与常见模型在实际场景中的对比效果,具体表现可参考视频。

Seed 2.0 Pro(左)与 Macaron-V1-Preview(右)效果对比,视频未加速
当前,后训练与持续学习已成为大模型进步的主要突破口。Claude Opus 4系列的持续更新也验证了以强化学习为核心的后训练是提升模型能力的关键——模型正沿着这条路径,从纯粹的聊天助手向能够执行复杂任务的Agent演进。
通过强化学习拓展后训练的上限,借助LoRA构建持续学习的技术底座。Macaron-V1-Preview的发布,不仅是Mind Lab对当下模型训练新范式的首次开源验证,也再次体现了开源与开放研究精神的传承。
Mind Lab 是谁?
作为中国首家Neo Lab,Mind Lab的团队实力不容小觑。公司创始人Andrew在深圳清华大学研究院担任研发中心主任,实验室负责人马骁腾是清华自动化系博士、博士后,核心研究团队约30人,团队成员累计发表200篇顶会论文,总引用次数超过5万次。其中,基础设施负责人来自DeepSeek,算法负责人来自字节Seed,模型团队成员则来自清华、MIT、NVIDIA、xAI等顶尖机构,长期专注于模型训练、强化学习以及高性能推理架构的研发。

早在Macaron-V1-Preview发布之前,Mind Lab就已积累了深厚的底层技术能力。去年底,他们与字节、英伟达合作,抢在OpenAI前CTO创立的Thinking Machines Lab之前,率先实现了“万亿参数LoRA强化学习”的基础设施建设,并获得了英伟达的官方转载认可。

英伟达官方转载了 Mind Lab 在「万亿参数 LoRA 强化学习」领域的技术突破
万亿参数模型的强化学习基础设施,是评判后训练实验室实力的试金石——除大厂外,此前仅有极少数海外Neo Lab掌握。这些底层积累与技术突破,为如今模型的高效后训练和持续迭代更新提供了关键的工程基础。
为Agent任务而生的模型
如果说以往的大模型发布更强调单项能力(如数学、代码或长上下文),那么Mind Lab的Macaron-V1-Preview则展现出一种更全面、更Agent-native的能力架构。
Agent任务往往复杂且模糊,既涉及生活场景,又可能延伸至复杂工具调用甚至代码执行。这是一条充满噪声的连续任务链路,需要从用户需求出发,进行多次真实交互与工具调用,直至任务最终落地完成。

任务链回放:一名大四女生首次独自去外地参加研究生复试,需要自行处理高铁到站后的路线规划、住宿安排、安全保障及预算控制等问题
Macaron-V1-Preview将这种复杂能力纳入了评测体系。它从一开始就面向真实的任务流、工具流、交互流和用户反馈进行优化,使模型学会了如何在具体的产品环境中有效行动。产品和模型都能在这一反馈循环中持续演进、不断迭代升级。
生活类Agent任务登顶SOTA
在美团定义的VitaBench和Mind Lab自研的LivingBench中,模型面对的是人们日常关心的吃喝玩乐、衣食住行问题,需要妥善处理到家、到店、OTA等服务场景。这些任务看似简单,但真正考验的是模型对用户偏好和真实处境的深度理解能力。Macaron-V1-Preview在这些任务中达到了当前最强表现,证明了它是一款能够真正融入生活场景的个人智能体。

任务链回放:柳州柳南区一位中年人常用的降压药(压氏达 / 苯磺酸氨氯地平片 5mg)在附近药店缺货,需在时间、预算、医保、用药安全等多重限制下寻找购药方案。(注:内容仅为产品功能演示,不构成医疗或用药建议。)
值得一提的是,LivingBench是Mind Lab围绕真实产品体验构建的基准测试,用于评估Agent在真实生活场景中的表现。正如姚顺雨在“智能下半场”中所言,构建有意义的Benchmark是当前打造模型最重要的任务。LivingBench构建了一个包含动态噪声、动态生活环境及动态用户反应的拟真沙盒,让任务像真实生活一样在互动中不断变化,从而观察模型能否持续理解用户需求、处理突发变化、保护隐私,并在用户耐心有限的情况下真正办好事情。

当发现难约的专家号时间与飞机时间冲突时,AI 如何给出合理建议
这种动态学习的理念,最早在CursorBench V3中提出。静态的能力评测并不能真实反映Agent为用户带来的实际价值,这已成为生产级Agent模型后训练领域的共识。
生成式UI效果领先
传统大模型通常采用长文本回答任务,这使用户承担了巨大的理解与执行负担。相比之下,Macaron-V1-Preview首次推出了支持Google A2UI(Agent to UI)协议的模型——得益于Mind Lab与TileRT团队在高速推理方面的技术合作,它能在5秒内快速生成高质量、可操作的动态UI,用户通过点击、滑动和确认即可推进任务。

Kimi K2-Thinking(左)与 Macaron-V1-Preview (右)效果对比,视频未加速
这种交互方式不仅方便了用户,也成为了将真实用户反馈转化为模型学习信号的关键桥梁。

Macaron-V1-Preview 测试复习单词、收拾行李场景,视频未加速
Macaron-V1-Preview在此关键维度上也斩获了SOTA,意味着它能够直接为用户生成更简单、更友好的交互方式。

测试生成小游戏、生成菜谱场景,视频未加速
有趣的是,这种展示方式对于学习理科知识似乎特别友好。

爱因斯坦的双胞胎悖论,通过可视化方式比纯文字更容易理解,视频未加速

康威生命游戏展示,视频未加速

展示 Mind Lab 近期发布的论文 δ-mem,视频未加速
通用能力比肩前沿模型
在多步任务处理能力方面,面向OpenClaw个人智能助理的PinchBench中,Macaron-V1-Preview获得了92.5分,成为该评测中表现最好的开源模型。这一评测集中检验模型处理多步任务的连续性以及应对用户反馈动态变化的能力——模型不仅需要理解每一步任务之间的逻辑关系,还需处理用户在不同步骤中偏好与反馈的变化。

Macaron-V1-Preview在此类复杂工作流中依然拔得头筹,验证了其真正具备多轮、多步、多反馈的真实Agent能力。

同时,Agent能力的强化训练并未导致模型其他基础能力下降。在客服工具调用任务(Tau3)、代码修复任务(SWEVerified)、终端交互任务(Terminal2)中,Macaron-V1-Preview的表现也接近了SOTA开源及闭源模型的水平。
面向Agent Harness的后训练方法
Mind Lab将模型的后训练过程直接置于Agent Harness环境中进行协同优化,使底层的Mixture-of-LoRA架构与顶层的路由、缓存调度、工具调用等Harness运行脚手架实现了原生协同设计。这意味着模型在训练阶段就已与实际执行环境深度适配。

这样一来,模型在部署到真实场景时几乎不存在“部署摩擦”,能够直接、稳定、高效地发挥Agent能力。这一智能体优化范式,在业界顶尖的Claude Code与Opus共同构建的生态中也得到了印证。
模型训练的基础设施,规模效应显现
Macaron-V1-Preview不仅是一款在Benchmark上表现优异的模型,它也展示了Mind Lab如何通过基础设施突破,使一个大型Agent模型能够在真实环境中持续获得能力提升。
一个大模型要服务真实用户任务,首先面临的是训练成本和推理效率问题。如果每次更新都需要完整重训,模型就无法高频地从真实任务和反馈中学习。因此,Mind Lab率先在万亿参数规模实现了基于LoRA(低秩自适应)、适配DSA(稀疏注意力)和MTP(多词元推理)的高效强化学习,将全尺寸模型的能力更新成本大幅降低。

DSA是一种高效的稀疏注意力机制,能够动态筛选重要的token,避免了传统Transformer全注意力机制平方级增长的计算复杂度。结合MTP可以进一步提高模型训练和推理效率,使Macaron-V1-Preview这样的749B级模型具备了可持续更新的基础条件。

*支持模型以下划线标注;M2.7 仅支持 MTP;Qwen3.6 支持 MTP,使用 Qwen-Next 而不是 DSA
LoRA与Mixture-of-LoRA:从后训练到持续学习
但成本问题不仅限于训练。在大规模应用场景中,模型能力的持续训练、频繁更新、切换部署都是巨大挑战。为此,Macaron-V1-Preview创新性地引入了Mixture-of-LoRA架构——它允许多个LoRA适配器同时独立存在于同一个基座模型之上(multi-serve),在避免昂贵的基模部署与切换开销的同时,在运行时通过路由器敏捷切换最合适的策略。

这种架构的优势在于,模型不再需要为每个任务、工具或用户偏好重新训练完整权重。不同任务、工具、交互模式、用户偏好等可以分别训练、独立存在,推理时只需激活相应的轻量LoRA参数。这种做法使模型能以更低的延迟、更高的效率处理多任务场景。使用Mixture-of-LoRA架构,不同能力无需被强行合并到一个静态模型中,使用者可以根据场景配置LoRA、训练新的LoRA,让模型不断进化、持续学习。
在Mixture-of-LoRA的基础上,Mind Lab将此前DeepSeek V4提出的三层缓存机制扩展为涵盖对象存储系统(OSS)的四层缓存机制。这种扩展使Mind Lab自主研发的基础设施能够同时训练和部署多达百万个LoRA适配器,并具备进一步扩展到千万个适配器的能力。

百万个LoRA的基础设施平台
Mind Lab也为Mixture-of-LoRA架构实现了完整的自研基础设施MinT(MindLab Toolkit),为万亿参数级模型提供以强化学习为核心的高效后训练。MinT能够管理上百万个LoRA模型,在训练、评估、部署和回滚过程中仅传输极为轻量的LoRA Adapter。这套基础设施使模型的实时加载速度提升了近十倍,使得百万级个性化和多策略适配成为现实。

近期,他们也将自己的基础设施成果以verl-mint的形式贡献给字节发起的强化学习框架verl-project。Mind Lab也坦诚,这套基础设施的建设离不开字节verl、英伟达Megatron-Bridge、加州大学伯克利分校vllm等开源社区伙伴的通力合作。

Mind Lab在最近发布的论文中提到,他们采用了LoRA、DSA、MTP、超低秩矩阵适配器、平行混合线性注意力等高效训练与推理关键技术,以应对现实中算力资源紧缺的客观条件。这些技术突破使他们能够在不到300张GPU卡的算力条件下,完成750B级别的Macaron-V1-Preview模型训练。值得一提的是,这些GPU中大部分并非英伟达最新的芯片型号,算力成本仅为其他同尺寸模型公司训练的不到1%。这也是包括DeepSeek等国产大模型公司,在有限资源条件下,于基础设施建设与训练推理效率方面追求极致的一个缩影。
展望新范式的全新可能性
在大量实践过程中,Mind Lab发现了一种与Mixture-of-LoRA架构紧密相关的规模定律,并用一篇43页的论文《On the Scaling of PEFT》详细阐述了这一发现:随着多样化模型数量的增加,基于分工协作的模型整体智能也会随之提升。

当大量拥有不同历史、偏好和技能的LoRA适配器形成一个大规模的适配器种群后,系统就可以利用这些适配器之间的差异,进行更高层次的协作与决策。系统可以通过路由选择、投票决策、多适配器检索与交叉验证等方式,将种群内部的多样性直接转化为系统整体智能水平的提升,从而实现模型性能和任务完成能力的有效增强。
在实际实验和测量中,Mind Lab进一步验证了这一全新的规模定律:远超于单一模型的分工协作,多个模型协作决策的准确性与模型数量之间呈现明显的对数增长关系,具体表现为:


模型数量的规模定律,揭示了模型数量扩展的巨大潜力。
Mind Lab或许希望通过Macaron-V1-Preview和这一系列技术突破,真正推动模型进入一个可以持续学习和不断进化的阶段——这或许也是模型后训练和持续学习领域的又一新范式。
真正的考验才刚开始
在算力资源紧缺的客观条件下,Mind Lab率先跑通750B DSA模型的LoRA后训练,与其说是技术奇迹,不如说是被现实倒逼出的务实选择。
公开资料显示,Mind Lab所属公司Mindverse心洲科技由粤港澳大湾区国家技术创新中心国际总部孵化。从重构基础设施、首创Mixture-of-LoRA架构,到扎根真实场景的Agent飞轮,这条低调务实的技术路线也体现出粤港澳大湾区的特色。Mind Lab正是基于这样的土壤,探索出一条模型和产品互相成就、面向真实任务与持续学习的模型工程路径。
据悉,已有头部手机厂商、头部可穿戴硬件厂商开始接触Mind Lab寻求合作,旨在将领先的生成式交互界面与生活Agent模型深度整合到更多硬件载体中。

Mind Lab负责人马骁腾曾在公开采访中表示:“我们不为刷榜做研究,也不为创新而做研究。我们是在为了真实的场景、真实的用户、真实的价值而做研究,并在这个过程中大胆地创新。”

能够做出开源的选择并不容易。从行业视角来看,Mind Lab是一股以不同路径突出重围的独特力量。在当下激烈的大模型竞争中,他们不仅与国内大模型厂商的开源模型同台竞技,也在全球市场正面迎接来自海外一线大模型厂商的挑战。Macaron-V1-Preview的发布是一次务实、大胆的亮相,但作为一家格外年轻的中小型前沿实验室,Mind Lab需要补足的短板、需要打磨的基本功仍有很多。唯有坚韧、专注,沉下心来,方有机会迎头赶上。

技术报告与在线体验:https://macaron.im/mindlab/research/macaron-v1-preview
开源模型权重:https://huggingface.co/mindlab-research/Macaron-V1-Preview-749B
