7月24日,蚂蚁百灵放出了一款很有意思的新模型——Ling-3.0-Flash。总参数量124B,单次计算激活5.1B,在大幅缩简体积的同时,算力开销也大幅降低。在基础推理、指令遵循和长文本处理这些核心指标上,它直接对标甚至反超了参数规模达其2到3倍的行业领先模型,展现出更高的“智效比”和落地性价比。目前该模型已上线OpenRouter,限时免费一周,之后将正式开源。
作为本次升级的重点,Ling-3.0-Flash对Agent实际应用场景进行了深度打磨。模型扩展了超过10000个真实交互训练环境,并优化了复杂任务的自我纠错与长程规划机制。无论是在代码编写、复杂任务拆解,还是多源信息深度调研等场景,它都展现出更强的自主闭环交付能力,解决了传统模型在大任务中容易“跑偏”或断档的难题。
那么,它到底是怎么做到的呢?答案藏在底层计算架构的重新设计里。Ling-3.0-Flash放弃了单纯堆砌参数的做法,从预训练阶段就采用混合注意力架构,以5:1的比例交替堆叠KDA线性注意力层与MLA层,在长上下文效率与模型能力之间实现了更优平衡。
此外,Ling-3.0-Flash将上一代的Lightning Attention升级为KDA,在Delta Rule的状态更新中引入细粒度对角门控,让模型在处理长文档和代码库时能更精准地记住关键信息。同时,进一步压缩了单次计算的专家激活比例,每个Token的专家激活比例由前代的1/32压缩至1/64,由此带来了更高的“效率杠杆”。
为了让AI Agent运行更快、更稳,百灵还为其匹配了配套的工程与协作架构。在响应速度上,通过引入集群级分级缓存,避免了长对话和多轮交互中的重复计算,将长输入下的首字响应延迟降低了60%至80%以上;在任务稳定性上,升级后的多智能体协同架构允许不同Agent分工协作、相互校验,有效减少了单一模型的误判风险,为高频线上服务与真实业务落地提供了支撑。
