游乐游手机版
首页/AI热点日报/热点详情

美团正式开源LongCat-Flash-Chat动态计算开启高效AI时代

类型:热点整理2026-07-23
美团开源LongCat-Flash-Chat,总参数560B的MoE模型,采用零计算专家与动态激活机制,每token仅激活18 6B至31 3B参数,平均约27B。推理速度超100tokens s,输出成本5元 百万token。训练30天完成,在ArenaHard-V2、MMLU、CEval等基准测试表现优异,智能体工具使用和编程能力领先,并开源SGLang

美团正式开源了 LongCat-Flash-Chat——一款总参数量高达 560B 的 MoE 架构大模型,推理速度轻松突破 100 tokens/s,输出成本仅为 5 元/百万 token。这组数字意味着什么?简单来说,高效 AI 应用的门槛正在被重新定义。

技术亮点:零计算专家与动态激活

LongCat-Flash 架构的核心创新在于引入了“零计算专家(Zero-Computation Experts)”机制。总参数 560B,但每个 token 仅根据上下文需求激活 18.6B 至 31.3B 参数——平均激活量约 27B。这相当于给算力加装了一个智能开关:需要时全力运转,不需要时绝不浪费。

美团正式发布并开源 LongCat-Flash-Chat,动态计算开启高效 AI 时代

训练层面,团队利用 PID 控制器实时微调专家偏置,将单 token 平均激活量牢牢锁定在 27B 附近。同时,层间铺设的跨层通道让 MoE 的通信与计算大幅并行——训练效率自然水涨船高。整套优化下来,模型在 30 天内完成高效训练,在 H800 上实现单用户 100+ tokens/s 的推理速度。

针对智能体(Agentic)能力,LongCat-Flash 自建了 Agentic 评测集来指导数据策略,训练全流程采用多智能体方法生成多样化高质量的轨迹数据。算法与工程联合设计的结果是:理论成本和速度大幅领先行业同等规模甚至更小的模型,输出成本低至 5 元/百万 token 的同时,生成速度依然保持在 100 tokens/s。

性能评估:全面且能打

图2:LongCat-Flash 的基准测试性能

LongCat-Flash 的基准测试性能

  • 通用领域知识:ArenaHard-V2 得分 86.50,位列所有评估模型第二;MMLU 89.71,CEval 90.44,性能比肩国内领先模型,且参数规模远小于 DeepSeek-V3.1、Kimi-K2 等产品。
  • 智能体工具使用:τ2-Bench 表现超越更大规模模型;高复杂场景下的 VitaBench 以 24.30 分拿下第一。
  • 编程能力:TerminalBench 得分 39.51(第二),SWE-Bench-Verified 得分 60.4,说明实际命令行任务处理能力扎实。
  • 指令遵循:IFEval 89.65(第一),COLLIE 57.10,Meeseeks-zh 43.03——中英文高难度指令集的双重冠军。

模型部署:开箱即用的高效方案

目前项目已提供基于 SGLang 和 vLLM 两套部署方案。以单机部署为例,使用 SGLang 的启动命令如下:

python3 -m sglang.launch_server \
    --model meituan-longcat/LongCat-Flash-Chat-FP8 \
    --trust-remote-code \
    --attention-backend flashinfer \
    --enable-ep-moe \
    --tp 8

所有细节均已在开源仓库中公开,感兴趣的团队可以直接拉取体验——毕竟,好的技术只有落地才能体现价值。

来源:https://www.53ai.com/news/OpenSourceLLM/2025090120481.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。