8 月 11 日消息,蚂蚁百灵今日在 Hugging Face 平台正式开源 Ling-3.0-tiny 模型。该模型采用轻量级混合推理 MoE 架构,总参数量为 7.9B,每个 Token 激活 1.3B 参数。当前已提供 BF16、FP8 和 INT4 多种权重版本,可满足不同硬件平台和本地部署场景的需求。

从公开资料来看,Ling-3.0-tiny 的核心方向是低成本推理与高效部署。该模型采用更强调效率的混合线性架构,将 KDA(Kimi Delta Attention)与 MLA(Multi-Head Latent Attention,多头潜在注意力)按照 3:1 的比例交替堆叠。同时,在前馈网络(FFN)部分引入包含 128 个路由专家(routed experts)的稀疏 MoE 设计,通过更精细的算力分配方式,尽可能在长上下文处理能力与计算成本之间取得平衡。
值得关注的是,这款大模型同时支持快速响应模式和多步骤推理模式,产品定位也十分清晰,主要面向本地部署和边缘推理应用场景。截至目前,Ling-3.0-tiny 已经在英伟达 DGX Spark、Apple Silicon MacBook 以及 Mac mini 等设备上完成验证。在搭载 M4 Pro 的 MacBook 上,其推理速度约可达到 86-90 Token/s;在 8K 上下文长度条件下,峰值内存占用约为 8.34 GiB。
参考:
inclusionAI/Ling-3.0-tiny · Hugging Face
