美团正式开源了 LongCat-Flash-Chat——一款总参数量高达 560B 的 MoE 架构大模型,推理速度轻松突破 100 tokens/s,输出成本仅为 5 元/百万 token。这组数字意味着什么?简单来说,高效 AI 应用的门槛正在被重新定义。
技术亮点:零计算专家与动态激活
LongCat-Flash 架构的核心创新在于引入了“零计算专家(Zero-Computation Experts)”机制。总参数 560B,但每个 token 仅根据上下文需求激活 18.6B 至 31.3B 参数——平均激活量约 27B。这相当于给算力加装了一个智能开关:需要时全力运转,不需要时绝不浪费。

训练层面,团队利用 PID 控制器实时微调专家偏置,将单 token 平均激活量牢牢锁定在 27B 附近。同时,层间铺设的跨层通道让 MoE 的通信与计算大幅并行——训练效率自然水涨船高。整套优化下来,模型在 30 天内完成高效训练,在 H800 上实现单用户 100+ tokens/s 的推理速度。
针对智能体(Agentic)能力,LongCat-Flash 自建了 Agentic 评测集来指导数据策略,训练全流程采用多智能体方法生成多样化高质量的轨迹数据。算法与工程联合设计的结果是:理论成本和速度大幅领先行业同等规模甚至更小的模型,输出成本低至 5 元/百万 token 的同时,生成速度依然保持在 100 tokens/s。
性能评估:全面且能打
图2:LongCat-Flash 的基准测试性能

- 通用领域知识:ArenaHard-V2 得分 86.50,位列所有评估模型第二;MMLU 89.71,CEval 90.44,性能比肩国内领先模型,且参数规模远小于 DeepSeek-V3.1、Kimi-K2 等产品。
- 智能体工具使用:τ2-Bench 表现超越更大规模模型;高复杂场景下的 VitaBench 以 24.30 分拿下第一。
- 编程能力:TerminalBench 得分 39.51(第二),SWE-Bench-Verified 得分 60.4,说明实际命令行任务处理能力扎实。
- 指令遵循:IFEval 89.65(第一),COLLIE 57.10,Meeseeks-zh 43.03——中英文高难度指令集的双重冠军。
模型部署:开箱即用的高效方案
目前项目已提供基于 SGLang 和 vLLM 两套部署方案。以单机部署为例,使用 SGLang 的启动命令如下:
python3 -m sglang.launch_server \
--model meituan-longcat/LongCat-Flash-Chat-FP8 \
--trust-remote-code \
--attention-backend flashinfer \
--enable-ep-moe \
--tp 8
所有细节均已在开源仓库中公开,感兴趣的团队可以直接拉取体验——毕竟,好的技术只有落地才能体现价值。
