美团最新发布的LongCat-Flash-Thinking推理大模型,在逻辑推理、数学计算、代码生成及智能体任务中展现出卓越性能,不仅全面超越OpenAI o3,更标志着美团在生活服务领域的AI能力正式进入“深度思考”时代。本文将从核心能力、技术创新、性能对比及本地生活场景独特优势等方面,全面解析该模型的强大之处。
一、核心能力:LongCat-Flash-Thinking究竟强在哪里?
LongCat-Flash-Thinking在继承龙猫系列高速度优势的基础上,大幅提升了深度推理能力。在多项权威基准测试中,该模型均取得开源模型SOTA(最佳水平)成绩,部分任务甚至逼近GPT5-Thinking。以下是各关键任务的具体提升数据:
- 通用推理能力(ARC-AGI基准): 相较于OpenAI o3,提升幅度达 6.34%。
- 数学能力:
- 在HMMT-25基准上:比OpenAI o3提升 1.86%。
- 在AIME-24基准上:比OpenAI o3提升 16.4%。
- 代码能力(LiveCodeBench基准): 比OpenAI o3提升 4.20%。
- 智能体能力(τ2-Bench-Airline基准): 比OpenAI o3提升 9.47%。
小提示: 上述数据来源于官方基准测试,实际应用效果可能因任务上下文复杂度不同而略有差异。
二、技术突破:又快又省的双路径推理框架
LongCat-Flash-Thinking在保持高速推理的同时,在AIME25测试中Token消耗比竞品低64.5%。这一优势得益于其创新的技术架构:
1. 分组独立训练,融合达到“帕累托最优”
美团将模型训练任务(如STEM知识、代码开发、智能体交互等)分解为多个独立小组,各小组专注于自身领域,互不干扰。训练完成后,再将各小组的成果进行融合。这种策略有效提升了模型整体能力的均衡性,最终达到资源配置的“帕累托最优”状态。
2. 智能体的“双路径推理框架”
这是LongCat-Flash-Thinking在智能体推理方面的核心创新。与GPT-5等模型需要用户主动选择是否启用工具不同,LongCat-Flash-Thinking具备自主决策能力,其工作流程如下:
模型自主判断 → 自动决定是否调用工具
具体来说,该框架能够:
- 自动筛选最优查询样本。
- 通过自动化流程,将智能体推理与工具调用融为一体。
- 智能识别并调用外部工具(如代码执行器、API等),高效解决复杂任务。
常见问题: LongCat-Flash-Thinking在智能体推理方面有何独特优势?
答案: 该模型实现了“模型驱动”的自主工具调用。传统模型需要用户预设是否使用工具(如联网搜索),而LongCat-Flash-Thinking可在推理过程中自动判断任务是否需要外部工具,无需用户提前指定,显著提升了任务处理的智能性和自动化水平。
三、性能对比:速度与效果的巅峰对决
为直观展示其性能优势,我们将其与同日发布的DeepSeek-V3.1-Terminus进行了对比测试。测试采用同一经典天气组件提示词(要求生成一个多条件天气组件),并关闭了联网搜索功能。
1. 速度对比
实际测试表明,LongCat-Flash-Thinking在生成速度上具有压倒性优势。加速视频(1.8倍速)显示,当DeepSeek-V3.1-Terminus仍在生成内容时,LongCat-Flash-Thinking已经完成输出。
(上方视频为DeepSeek-V3.1-Terminus,下方为LongCat-Flash-Thinking,均按1.8倍速播放)
小提示: 视频经过加速处理以便对比,实际使用中,LongCat-Flash-Thinking的响应速度远快于视频展示。
2. 效果对比
从生成结果看,两者完成度均很高,但各有侧重:
- DeepSeek-V3.1-Terminus: 生成的天气组件动效更强。
- LongCat-Flash-Thinking: 生成的UI组件排版更佳。
四、编程与数学能力实例
LongCat-Flash-Thinking还扩展了形式化定理证明能力(在MiniF2F-test基准上),成为国内首个同时具备“深度思考+工具调用”与“非形式化+形式化”推理能力的大语言模型。我们用一个高难度AIME(美国数学邀请赛)路径规划问题来验证其能力:
题目: 每天早上,小美会进行9公里长的散步,随后在咖啡馆休息。当她以每小时s公里的恒定速度行走时,整个行程(含咖啡馆休息t分钟)需要4小时。若以每小时s+2公里的速度行走,则整个行程(含t分钟休息)需要2小时24分钟。假设亚衣以每小时s+1/2公里的速度行走,求整个行程需要多少分钟(含咖啡馆休息时间)。
结果: 两款模型均正确解得204分钟。
差异:
- 解题过程: LongCat-Flash-Thinking的解题步骤更紧凑,且主动使用Python编写代码验证演算过程。
- 计算习惯: LongCat-Flash-Thinking偏好使用小数运算,而DeepSeek-V3.1-Terminus偏好使用分数。
常见问题: 什么是“形式化定理证明”?
答案: 形式化定理证明是一种在精确的形式化语言(如逻辑语言)定义的公理和规则系统中,严格按照步骤推导命题的过程。每一步都必须遵循预设的推理规则,不能依赖直觉。与之相对的是非形式化证明(如数学课本中的常见证明),后者为可读性而省略步骤,依赖读者的背景知识。
五、美团为何自研模型?本地生活数据护城河
面对“为何不接入DeepSeek而选择自研”的疑问,答案在于美团所拥有的独一无二本地生活数据。
第三方模型训练主要依赖网页数据、数学数据、代码和智能体数据等公开资源。而美团在处理外卖、电影、餐厅预订等真实用户行为过程中积累的海量数据,是互联网世界独一无二的“金矿”:
- 知晓用户去过的店铺、点过的外卖类型及频率。
- 了解用户观影、观演等生活娱乐偏好。
- 能根据历史行为进行精准店铺推荐。
这些数据构成了美团在AI领域的天然技术护城河。无论是首页越来越懂你的AI搜索、能替社恐用户打电话的AI订座,还是自动为你开发片的助手,LongCat系列模型并非凭空诞生,而是在这些真实场景中经历了无数次“实习”,不断学习与优化。
正如作者所说:“没有一家大模型能有那么多真实数据,也没有一家能清楚我们一年去过哪家店铺次数最多...你又有什么理由不相信LongCat这个系列会打破目前趋向稳定的模型格局?”
六、开源与使用
LongCat-Flash-Thinking现已完全开源,您可通过以下链接获取和体验:
- 模型下载: huggingface.co/meituan-longcat/LongCat-Flash-Thinking
- 代码仓库: github.com/meituan-longcat/LongCat-Flash-Thinking
同时,在 longcat.ai 的交互界面上,新增了“深度思考”按钮,方便您直接体验其强大的推理能力。
小提示: 在实际使用或部署时,请配置合适的硬件环境,以充分发挥其性能优势。
