美团 LongCat 团队正式发布了一款能力强劲的全新推理模型——LongCat-Flash-Thinking。该模型不仅保持了极速响应特性,还在多个领域达到了全球开源模型的顶尖水准,更关键的是,它首次将深度思考与工具调用能力创新性地融为一体,让模型既能“深入剖析”,又能“精准执行”。本文将从核心亮点、关键技术、性能表现到实际应用,带你全面了解这款模型的强大之处。
一、模型核心亮点速览
- 多领域 SOTA 性能:在逻辑推理、数学运算、代码生成、智能体任务等场景下,均达到开源模型的最先进水平。
- 极速+深度思考:在保持 LongCat-Flash-Chat 极致推理速度的同时,大幅提升了模型的深度推理能力。
- 首创“深度思考+工具调用”:国内首个同时具备深度推理与自主调用外部工具(如代码执行器、API)的大语言模型。
- 形式化推理能力:支持形式化定理证明,确保推理结果的高可靠性与严谨性。
二、核心技术详解
LongCat-Flash-Thinking 之所以能取得突破性成绩,主要得益于以下三大创新技术。
1. 领域并行强化学习训练方法(Domain-Parallel RL Training)
在强化学习训练过程中,不同领域(如STEM、代码、智能体任务)的优化目标往往相互冲突。为此,团队设计了领域并行方案,将各领域的优化过程解耦,采用“多领域并行训练再融合”的先进策略,使模型能力均衡提升,最终达到帕累托最优(Pareto-Optimal)状态。

图1:LongCat-Flash-Thinking 的训练流程示意
2. 异步弹性共卡系统(DORA)
DORA 是整个训练体系的“基石”。它通过弹性共卡调度与多版本异步流水线设计,实现了以下显著优势:
- 训练提速 3 倍:相比传统同步强化学习框架,速度提升明显。
- 万卡级稳定运行:支持大规模集群,保证每条样本的策略一致性。
- KV 缓存复用:高效利用缓存,有效降低计算开销。
- 算力投入仅为预训练的 20%:在大规模异步 RL 训练阶段,FLOPs 投入相对较小,却能带来显著的性能提升。
小提示:如果你需要训练超大规模模型,DORA 系统的设计思路(弹性调度+异步流水线)可以极大提升训练效率,尤其适合预算有限的团队。
3. 智能体推理框架(Agentic Reasoning Framework)
为提升模型在复杂智能体任务中的表现,团队提出了“双路径推理框架”。该框架能自主筛选最优查询样本,并通过自动化流程将智能体推理与工具调用相结合,让模型智能识别并调用外部工具(如代码执行器、API等)。
- 基于 AIME25 实测数据:在确保 90% 准确率的前提下,Tokens 消耗从 19653 降至 6965,节省了 64.5% 的 Token 资源。
4. 形式化推理框架(Formal Reasoning Framework)
针对当前开源模型在形式化证明中的不足,团队设计了基于专家迭代框架的数据合成方法。该流程利用集成 Lean4 服务器的专家迭代框架,生成经过严格验证的证明过程,系统性提升模型的形式化推理能力,大幅提高了在学术和工程应用中的可靠性。
三、性能评测与基准表现
LongCat-Flash-Thinking 在多项权威评测中刷新纪录,以下为其在各领域的亮眼表现:
(说明:此图与上文图1为同一示意图,实际评测数据请参照下表)
图2:在推理基准测试上的平均性能比较
通用推理能力:在 ARC-AGI 基准测试中,以 50.3 分 超越 OpenAI o3、Gemini2.5 Pro 等顶尖闭源模型,展现了结构化逻辑的卓越实力。
数学能力:在 HMMT 和 AIME 相关基准上取得突破性成绩,超越 OpenAI o3,与 Qwen3-235B-A22B-Thinking 等领先模型水平相当,擅长解决复杂多步问题。
代码能力:在 LiveCodeBench 上以 79.4 分 显著超越所有参与评估的开源模型,与顶级闭源模型 GPT-5 表现相当;在 OJBench 上以 40.7 分 保持极强竞争力。
智能体能力:在 τ2-Bench-Airline 上以 67.5 分 刷新开源 SOTA 成绩,并在 SWE-Bench、BFCL V3 和 VitaBench 等基准中展现出超强竞争力。
ATP 形式推理能力:在 MiniF2F-test 基准中,pass@1 获得 67.6 的极高分数,大幅领先所有其他参与评估的模型,pass@8 和 pass@32 同样保持领先。
四、常见问题(FAQ)
Q1:LongCat-Flash-Thinking 与普通大模型有什么区别?
A:其核心区别在于同时整合了“深度思考”和“工具调用”。普通大模型只能输出文本推理,而 LongCat-Flash-Thinking 可以自主判断是否需要调用代码执行器、API 等外部工具,再基于工具结果进行更准确的推理。这使其在需要多步计算、事实查询或代码执行的复杂任务中表现更佳。
Q2:为什么需要“领域并行强化学习训练”?
A:因为不同任务(如数学、代码、智能体)的优化方向可能互相干扰。传统混合训练容易导致模型在某些领域能力下降。领域并行方案通过解耦各领域的优化过程,再巧妙融合,实现了各领域能力的均衡提升,避免顾此失彼。
Q3:DORA 系统具体是如何提升训练效率的?
A:DORA 系统通过弹性共卡调度,让多张GPU协同工作,避免资源闲置;同时采用多版本异步流水线,允许不同版本的模型并行生成数据,大幅缩短训练周期。此外,KV 缓存复用技术减少了重复计算。综合下来,训练速度提升 3 倍,并且能够在万卡规模下稳定运行。
Q4:模型的形式化推理能力有什么实际应用?
A:形式化推理(如数学定理证明、协议验证)对结果的严谨性要求极高。LongCat-Flash-Thinking 能够生成经过严格验证的证明步骤,可用于学术研究中的自动定理证明、软件安全中的形式化验证、以及需要数学严谨性的工程场景(如航空航天、金融风控)。
五、小提示:如何更好地使用 LongCat-Flash-Thinking?
- 复杂推理任务优先:需要多步逻辑、高精度计算或代码生成的场景(如竞赛题、数据分析、自动化脚本编写),使用该模型效果最佳。
- 善用工具调用:当任务需要外部知识(如实时数据、执行代码)时,可明确引导模型调用工具,以提升准确率并节省 Token 消耗。
- 注意资源规划:虽然推理速度极快,但大规模调用模型时仍建议根据实际需求调配计算资源,尤其在使用智能体框架时,合理设计查询样本能进一步优化成本。
结语
LongCat-Flash-Thinking 的发布,标志着开源大模型在深度推理与工具调用融合上迈出了关键一步。无论是数学、代码还是智能体任务,它都展现了令人惊叹的实力。随着领域并行训练、异步弹性系统等技术的成熟,未来的模型将更智能、更高效。现在就上手体验吧——你会发现,思考和行动可以如此完美地结合在一起。
