游乐游手机版
首页/科技数码/文章详情

小米MiMo借势DeepSeek入局大模型竞争牌桌

时间:2026-08-18 11:08
小米MiMo-V2 5系列API永久降价,对标DeepSeek价格,缓存命中价低至0 025元 百万tokens。通过多级存储与KVCache优化大幅降低成本,旨在借助DeepSeek价格锚点进入开发者候选名单。

5月27日,小米宣布对 MiMo-V2.5 系列 API 进行永久性降价。

具体来看,MiMo-V2.5-Pro 的输入缓存命中价格下调至 0.025 元/百万 tokens,输入未命中价格为 3 元/百万 tokens,输出价格为 6 元/百万 tokens。标准版 MiMo-V2.5 的价格更低:缓存命中 0.02 元/百万 tokens,输入未命中 1 元/百万 tokens,输出 2 元/百万 tokens。

这显然不是一次普通的限时促销。

把价格横向对比后就会发现,小米这次降价并不是简单调整,而是明显在对标 DeepSeek——MiMo-V2.5-Pro 对应 DeepSeek V4-Pro,MiMo-V2.5 对应 DeepSeek V4-Flash。

如今,DeepSeek 已经不只是一个大模型名称。至少在国产大模型市场里,它正在逐渐变成一把衡量 API 价格的标尺。

这把“价格尺子”持续拷问着各家大模型厂商:你的模型 API 到底卖多少钱?

这个问题平等地摆在所有玩家面前,同时也带来了新的市场机会。像小米 MiMo 这样的后来者,策略上可以更灵活,也更有机会借着 DeepSeek 设定的价格锚点,为自己争取一个进入主流竞争牌桌的机会。

token的价格划分越来越细了

先来看这次 API 降价具体是如何发生的。

在这张价格表中,最值得注意的细节,是把缓存命中和缓存未命中明确拆分成了两套价格体系。这其实已经成为当前大模型价格战背后的关键逻辑。

所谓缓存命中,简单来说就是:如果当前请求的前缀内容,和之前某次请求的前缀一致,平台就不需要从头重新计算,而是可以直接复用此前保存的中间结果。

大模型处理长上下文时,成本通常可以分成两部分。第一部分叫 prefill,可以理解为“读题”——系统提示词、项目代码、企业知识文档、历史对话等内容,都要先被模型读入。第二部分叫 decode,可以理解为“答题”——模型再一个 token 一个 token 地生成最终回复。

过去大家讨论大模型 API 价格时,主要关注输入和输出成本。但现在,大模型越来越多地被应用在 Agent、AI 编程、知识库问答和长对话等场景中,许多输入内容实际上是反复重复的。比如代码助手每次都要读取同一个代码仓库,企业智能助手每次都要加载同一批规章制度文档,Agent 每一轮调用都会附带相同的工具说明和系统规则。很多时候,真正变化的只是最后那一句用户指令。

这时,缓存就成为影响大模型推理成本的重要变量。第一次做题需要完整打草稿,第二次如果题目前半部分相同,就没必要重新打一次草稿。缓存命中价格之所以能低到惊人,核心原因就在这里。以 MiMo-V2.5-Pro 为例,未命中输入价格是 3 元/百万 tokens,而缓存命中后只要 0.025 元/百万 tokens,价差高达 120 倍。

价格战的意味确实越来越浓,但大模型厂商已经不再把 token 当成一种完全统一的标准商品来出售。新的输入、缓存输入、输出 token,背后对应的是三种不同的成本结构。这一轮大模型 API 降价,不是“所有 token 一起变便宜”,而是厂商开始根据真实推理成本,把 token 进一步拆分并重新定价。

降价来自“机房”

“最高降幅 99%”当然是最吸引眼球的卖点,但真正的门道其实来自更底层的技术和基础设施优化。

在降价公告中,小米团队提到,他们基于 SGLang HiCache 完整支持 SWA(Sliding Window Attention),将 KV Cache 在 GPU 显存、CPU 内存、SSD 多级存储之间的数据搬运量降低到了优化前的近 1/7,同时把可缓存 token 数量提升到接近 5 倍。

这段表述,解释了此次 API 永久降价背后的另一层原因。

大模型每生成一个 token,都需要参考此前的上下文。如果每一步都把全部上下文重新计算一次,整体成本会非常高。KV Cache 存储的,就是前面 token 在注意力机制中计算出的 Key 和 Value——它相当于把模型已经读过的内容,转化成可以反复复用的“计算草稿”。

但这份草稿也需要存放空间。最理想的位置是 GPU 显存,速度最快,但成本也最高;其次是 CPU 内存;再往下则是 SSD,虽然便宜,但速度更慢。缓存规模越大,就越不可能全部放在显存中。因此,哪些缓存放进显存,哪些放在内存,哪些转移到 SSD?什么时候迁移?迁移多少?又怎样避免数据搬运本身拖慢推理效率?这正是小米公告中“多级存储之间的数据搬运量降低”的真实含义。

过去为了复用上下文,要么长期占用昂贵显存,要么频繁在不同存储层之间来回搬运,结果省下来的计算成本,很可能又被搬运成本抵消掉。现在,随着系统调度能力更强,缓存搬运更少、可存内容更多、命中率更高,缓存价格才真正有条件继续往下打。

所以,如果低价只是靠补贴,那本质上仍然是烧钱换流量;但如果低价来自 KV Cache、SWA、多级存储、专家并行以及输入长度分桶等推理基础设施优化,那它就代表一种长期可持续的能力。前者只能带来阶段性的用户增长,后者才有可能真正重塑大模型 API 的长期价格体系。据小米透露,相关技术细节更完整的论文也会在稍后发布。

DeepSeek出的题,能不能变成小米的稻草

降价无疑会在短期内为一个模型带来更多用户,而小米这次的降价,除了技术优化带来的可能性之外,其实也明显设计了时点和节奏——它选择在 DeepSeek 刚完成新一轮降价之后,迅速贴身跟进。

DeepSeek 给所有大模型厂商出了一道现实难题:当像 DeepSeek 这样能力强的模型也能以低价开放 API 调用时,其他模型厂商凭什么继续维持原有价格?

过去,国产模型公司只要比 GPT、Claude 更便宜,就能够解释自己的性价比优势。但在 DeepSeek 把价格锚点进一步拉低之后,整个行业进入了一个更难受的阶段。如果你的价格比 DeepSeek 高出很多,就必须证明自己的模型能力强出很多;如果能力接近,就必须证明自己响应速度更快、服务稳定性更好、生态兼容更顺畅;如果能力、价格和使用体验都没有明显优势,就只能退守到更细分的垂直场景里——比如多模态、端侧模型、企业私有化部署、行业专用模型或工具链绑定。如果这些差异化能力也不存在,那就只能更早退出竞争。

DeepSeek 像一条鲶鱼,它未必让所有模型立刻一起降价,但它让“贵”这件事必须重新被解释。Claude 可以用 coding 和复杂任务处理能力解释自己的价格,GPT 可以用成熟生态、多模态能力和工具链整合解释自己的价格。那么,小米这样尚未形成明显用户规模效应的后来者,又该如何回答这个问题?尤其是目前小米的核心基本盘,并不在一个独立的大模型品牌上,而是在手机、汽车、IoT、HyperOS 和智能硬件生态之中。

所以,MiMo 当前最大的挑战,无论对内还是对外,都是:一个并非开发者默认首选的基础模型,如何先进入开发者的大模型候选名单?

这一次,MiMo 显然决定抓住 DeepSeek 这根“价格稻草”,在价格层面进行像素级对标——这或许已经是最现实的机会。它必须借着 DeepSeek 设定的市场标准,才有可能真正坐上牌桌。只有把 API 价格打到与 DeepSeek 同一档位,开发者才可能愿意尝试。在 API 市场里,开发者不会无缘无故把调用量交给一个新模型。尤其是在 Agent、Coding、长上下文等高频调用场景中,一次任务往往就是几十轮模型调用。只要价格比 DeepSeek 高出一截,开发者甚至还没来得及体验模型差异,就已经先被账单劝退了。

而另一侧的压力其实也来自小米内部:MiMo 需要尽快证明,自己到底能不能成长为小米生态里的 AI 基础能力。对小米来说,大模型 API 业务未必是终点。它真正想进入的,不只是开发者控制台,而是自家完整的智能生态场景。但模型要进入这些场景,不能只靠发布会或参数表。它需要足够多的真实调用,需要开发者在真实任务中反复测试,也需要用户在长对话、代码生成、Agent、知识库、车机交互和设备控制等应用场景中持续使用。只有当这些真实使用数据不断回流,模型才能知道哪些能力真正有价值,哪些场景值得持续优化,哪些接口设计需要重构。

于是,哪怕罗福莉前不久刚提出模型不能“盲目降价”,今天 MiMo 也必须主动发起这场价格战。而罗福莉最新的推文,也对这一点做了进一步解释:“在新降价后的API价格下运行,我们的生产推理引擎接近满负荷运转,仍能基本实现收支平衡。我们此前建议LLM公司不要盲目降价,正是因为很少有模型架构和推理优化能让API成本避免亏损。如果更多节省计算和KV缓存的架构出现,并辅以更优的推理基础设施来压低API成本,这将在行业内形成一个极佳的良性循环。”

在刚刚降价一天的时间节点上,这样的描述看起来更像一个理想化假设。如果做成了,MiMo 就真正站上了牌桌;如果做不成,那就会是另一个完全不同的故事。

来源:https://www.163.com/dy/article/KU0R5VC90511N33R.html
上一篇拼多多开启新一轮投资周期:以短期利润换长期增长 下一篇闪迪SATA SSD新品520与320曝光,基于可信NAND技术
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
科技数码 · 2026-08-31

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
科技数码 · 2026-08-28

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
科技数码 · 2026-08-28

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

行李箱选购全攻略:材质、轮子与尺寸避坑指南
科技数码 · 2026-08-28

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
科技数码 · 2026-08-28

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。