游乐游手机版
首页/AI热点日报/热点详情

蚂蚁集团发布百灵原生混合推理模型Ling-3.0-flash 124B能力对标上一代旗舰

类型:热点整理2026-07-25
蚂蚁集团发布百灵Ling-3 0-flash原生混合推理模型,总参数量124B,激活参数仅5 1B,能力对标上一代1T参数旗舰。采用5:1交替堆叠KDA与MLA的混合线性架构及稀疏MoE,长上下文处理效率提升,TTFT降低60%至80%以上,Agent任务实现长程闭环。

7月24日,蚂蚁集团旗下百灵大模型正式发布新一代原生混合推理模型——Ling-3.0-flash。值得关注的是,这款模型在参数规模上大幅精简,但能力表现反而对标甚至超越了上一代旗舰产品,实现了“以小博大”的技术突破。

蚂蚁集团发布百灵原生混合推理模型 Ling-3.0-flash:124B 总参数量,能力对标上一代旗舰 Ring-2.6-1T

官方数据直观展现:上一代旗舰思考模型 Ring-2.6-1T 参数量达 1T(万亿),而 Ling-3.0-flash 总参数量仅 124B(1240亿),约为前者的 12.4%;激活参数量更是压缩至 5.1B,仅相当于 Ring-2.6-1T 的 8.1%。在如此悬殊的规模差距下,Ling-3.0-flash 却在多个维度实现能力对标甚至超越——这才是真正的“以小博大”式技术创新。

具体来看,Ling-3.0-flash 的核心改进集中在三个方向:

  • 混合线性架构,原生进化。从预训练阶段就引入自研混合线性注意力架构,采用 5:1 交替堆叠 KDA 与 MLA 的设计。同时升级全新 KDA 细粒度对角门控,以及 1/64 稀疏 MoE(混合专家)。在 124B 总参数、5.1B 激活参数的规模下,长上下文处理效率、状态记忆能力和计算成本之间实现协同跃升,这一平衡点选择相当精准,为小参数模型提供了大模型级别的推理能力。

  • 极致智能密度,越级挑战。追求“快、省、可落地”的智能密度和智效比极限,是这代模型的核心设计思路。仅 5.1B 激活参数,就能提供出色的传统推理、指令遵循和长文本处理能力——这意味着在复杂 Agent 应用场景中,它能以更低成本实现更高效的应用落地,特别适合企业级 AI 部署需求。

  • Agent 全面进化,长程闭环。围绕真实生产力场景,模型训练环境扩展至 10,000+ 个可交互场景。Coding(代码生成)、General(通用任务)与 Deep Research Agent(深度研究智能体)均能实现全程闭环,官方总结为“能力强、响应快、协同稳”。更值得一提的是,创新接入了 SGLang HiCache 和 Mooncake 分级缓存架构,采用物理双池、集群共享 L3 设计,使得长程交互无需重复计算,长输入下的 TTFT(首 token 生成时间)降低 60% 到 80% 以上,大幅提升实时交互体验。

目前,Ling-3.0-flash 已在 OpenRouter 和百灵官方平台同步开放限时免费 API 调用,免费期截止至北京时间 8 月 3 日 23:00。更值得期待的是,模型权重将在免费期结束后正式开源——这意味着开发者很快就能拿到这个“小而强”的模型,在实际场景中验证其真实能力,推动 AI 技术的普惠应用。

来源:https://www.ithome.com/0/981/382.htm

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。