5月27日,小米正式放出重磅消息——MiMo-V2.5系列大模型API宣布永久调价,最高降幅高达99%,并且不再区分上下文长度。这一轮价格下探,几乎可以说是把大模型API价格直接压到了行业极低水平。
具体来看,MiMo-V2.5-Pro的定价非常有冲击力:每百万tokens输入在缓存命中的情况下仅需0.025元;若缓存未命中,价格为3元;输出价格则为6元。除此之外,在Token Plan方面,小米还推出了“加量不加价”的策略:用户在Agent和代码生成等场景下可使用的Token额度直接提升至原来的5到8倍,同时计价方式升级为“所见即所得”,省去了以往复杂的换算规则,使用和成本核算都更加直观。
值得注意的是,就在上周,DeepSeek才刚刚宣布V4-Pro永久降价至原价的25%。短短一周时间,国内头部大模型厂商连续两次进行大幅调价,这样的节奏和力度,确实让市场颇感震动。
如果放在全球大模型API价格体系中比较,DeepSeek与小米目前的最新报价,已经明显低于主流海外厂商。作为参考,OpenAI GPT-4o的标准输入价格为每百万tokens 2.5美元,输出10美元;Claude Sonnet 4.6输入3美元,输出15美元。这样换算下来,小米在缓存命中情况下的输入成本,几乎低到可以忽略。
不过,这并不只是单纯依靠低价“烧钱”抢占市场。小米此次大模型API降价的底气,核心来自推理系统与工程层面的深度优化。根据官方说明,他们基于SGLang HiCache完整支持了Sliding Window Attention(滑动窗口注意力机制),将KV Cache在GPU显存、CPU内存、SSD等多级存储之间的数据搬运量压缩至优化前的约七分之一,同时可缓存的token数量提升了接近5倍。缓存命中率提升后,模型推理效率自然随之提高。再配合优化专家方案、输入长度分桶策略等手段,整体集群的输入吞吐能力也被进一步增强。
从这个角度看,小米的思路与DeepSeek其实高度一致——都是通过模型架构创新与推理系统工程化优化,系统性降低单位Token的服务成本,再把这部分成本红利直接释放给开发者和企业用户。
归根结底,这一轮国产大模型降价潮背后,反映的是应用场景正在发生深刻变化。大模型已经从“聊天问答”逐步走向“实际干活”的阶段。如今真正让开发者和企业关注的,早已不是单次对话要花多少钱,而是Agent在多轮推理、工具调用、自动化工作流等场景中持续消耗的Token总成本。当每百万Tokens的价格不断被压低,国内大模型市场的竞争也必然进一步向应用层和产业链下游传导。
对于开发者而言,成本下降意味着更多Agent应用、AI自动化工具和代码场景有望迎来井喷式增长;对于厂商而言,低价竞争背后比拼的则是更高效的模型推理能力、更强的算力调度水平,以及更长期的生态建设投入。价格战未必能直接决定谁拥有最强的大模型,但一定会加速模型API被开发者真正用起来。小米MiMo选择在这一时间点大幅降价,也正是国产大模型迈向“规模化落地与规模化使用”的又一个鲜明信号。

