炒股就看金麒麟分析师研报,权威、专业、及时、全面,助您挖掘潜力主题投资机会!
(来源:中国新闻周刊)
“没人会抱怨人工智能成本,直到AI账单贵得惊人。”这是美国创业者Ben Cera在7月底于社交媒体发布的一条帖文。
过去一段时间,这种感受已成为不少美国开发者和企业的共同体验。凭借突出的性价比优势,中国开源大模型正把他们从高昂的人工智能使用成本中“解救”出来。
随着越来越多美国市场开始采用中国大模型,外界甚至描绘出这样一幅图景:中国大模型像其他中国制造商品一样,依靠高性价比快速走向全球,并在一定程度上倒逼OpenAI、Anthropic等美国AI巨头调整价格。
一场围绕企业级用户的AI大模型竞争确实已经打响,但中国大模型要想在海外市场真正站稳脚跟,仍然面临不小挑战。

AI插画/adan
AI账单失控了
去年10月,Ben Cera创办了一家“一人公司”Polsia,为其他企业提供策划、编程、市场营销等方面的人工智能生产力服务。尽管他清楚Anthropic和OpenAI的模型价格不低,但起初并未太在意,反而更关注客户是否愿意为公司开发的AI产品买单。
到了今年3月,Ben Cera开始意识到AI成本正在失控。随着Polsia受到越来越多关注,付费用户从500人增长到5000人,他收到的AI账单高达50万美元。当时他主要使用的是Anthropic旗下的Opus和Sonnet模型。他不得不寻求更多融资,“这样才能缓解AI账单带来的压力”。
融资让Ben Cera暂时获得了喘息空间,但他也清楚,公司每月在大模型上的支出正逼近100万美元。他不断在成本与收入之间艰难平衡。随着用户继续增长,到今年4月,他又收到了一张接近120万美元的AI账单。他面临两种选择:要么提高产品收费,要么尽快找到更低成本的替代方案,而依靠Anthropic的模型显然难以实现这一点。“如果用户数量从5000人增长到5万人,我可能3个月内就会把融资烧光,所以在扩大规模之前,必须先解决AI成本问题。”
多数Polsia用户提出的需求其实并不复杂,Polsia也能够提供相对标准化的答案。因此,公司必须以尽可能低的成本提供服务,并通过较低价格吸引更多用户。这正是Ben Cera当时最棘手的现实问题。
随后,他开始通过租用GPU来部署开源模型。两个月后的6月,公司在人工智能方面的月支出已降至10万美元左右,他采用了Minimax和GLM模型。“这意味着公司终于可以盈利,而且还能以更低价格向客户提供服务,甚至推出免费版。”
在Ben Cera那条帖子下方的评论区,有人创造了一个新词:Chinamaxxing。这个词戏仿Tokenmaxxing,意思是与其像过去那样不惜成本地“烧”Token,不如尽可能多地使用中国大模型。
如今,Chinamaxxing在硅谷开发者和初创公司中已逐渐演变成一股趋势。第三方模型聚合平台OpenRouter数据显示,8月3日至7日这一周,DeepSeek-V4-Flash新旧版本合计调用量达到11.31万亿Tokens,而GPT5.6 Luna调用量为3.54万亿Tokens,二者相差接近三倍。在此前一周的大模型调用排行榜中,排名前五的产品也全部来自中国模型。
而且,这一趋势并非短期现象。OpenRouter数据显示,用户对中国模型的Token消耗占比增长明显,2025年上半年这一比例仅为4.5%,此后一路攀升,达到如今的百分之五六十。
“这并不意味着中国模型已经拿下美国企业市场一半以上的份额。OpenRouter更多体现的是开发者和初创公司使用大模型的趋势。”人工智能第三方数据公司XSignal CEO刘震告诉《中国新闻周刊》,今年美国企业用户市场中,开源模型占比不到15%,而中国模型在开源模型中的占比约为20%—30%,整体市场占比仅在3%—5%之间,而2025年这一比例大约只有1%。
因此,现在还很难说美国企业已经集体转向中国大模型。但无论是Ben Cera这样的创业者,还是部分大型企业,确实都开始明显感受到AI账单带来的压力。
今年7月起,微软开始为各业务部门设定“AI Token预算目标”,并将GPT 5.6设为内部默认模型,原因很直接:便宜。公司CEO纳德拉在6月参加一档播客节目时就提到,微软内部存在不少Tokenmaxxing现象,他本人也承认,疯狂刷Token确实容易让人上瘾。但问题在于,生产率提升带来的边际收益,必须与Token的边际成本相匹配。并不是所有问题都值得调用最强、最贵的前沿大模型,模型运行更久、Agent调用更多,也不一定意味着结果更好。
大模型“价格战”?
截至2026年7月,DeepSeek-V4-Flash的输入Token价格为每百万0.14美元,而OpenAI的GPT 5.5报价为5美元,价格差距根据具体场景在4倍到100倍之间浮动。OpenRouter表示,中国开源模型的价格普遍比Anthropic、OpenAI的旗舰模型便宜60%到90%。
就在过去几周,一张关于AI大模型性价比的图表开始在海外社交平台广泛传播。图表横轴代表大模型完成一项任务所需的成本,纵轴代表模型的智能水平,用于衡量大模型“性能/价格比”。在这张图里,多数模型都被认为处在DeepSeek的“斩杀线”之下。换句话说,这些模型的智能水平不如DeepSeek-V4,但价格反而更高。
随后,OpenAI宣布下调模型价格。GPT 5.6系列于7月9日正式发布,其中Luna版本上线仅三周,价格就被下调至原来的五分之一。Luna是GPT 5.6系列中速度最快、价格最低的一档,主要面向批量内容处理、信息提取、智能客服、翻译、代码辅助以及轻量Agent等高频应用场景。这也让外界闻到了中美大模型市场“价格战”的味道。
刘震认为,用“价格战”来描述当前大模型市场并不准确。这并不是一个简单的“国产模型把OpenAI、Anthropic价格打下来”的故事,而更像是AI模型应用进入新阶段后的必然结果。
如果观察OpenAI当前的营收结构可以发现,其收入目前主要仍来自个人订阅,企业业务占比并不高。这也意味着OpenAI、Anthropic都在将战略重点转向企业级市场。
对于企业客户来说,并非所有场景都必须使用智能水平最高的模型,而是需要根据不同业务场景进行分层匹配,选择更适合的模型。这也是为什么OpenAI、Anthropic会下调部分中低阶模型价格,希望通过产品分层策略——例如让Luna降价——去覆盖那些对成本更敏感、但所需智能水平相对较低的工作场景,从而打开B端市场。不过,最顶级的模型价格并未调整。
相比“降价”,刘震更倾向于将其理解为产品线重构,即拉开廉价、中端、高端和顶端模型之间的价格梯度。“在美国,大模型路由的概念已经比较成熟,企业会依据应用场景选择不同智能层级的模型,国内类似理念也正在发展。”
美国外卖平台DoorDash联合创始人、CTO Andy Fang在7月初的社交媒体发文中提到,公司开始把较低级别的工作交给Kimi K2.6处理,只将“最困难的工作”交给Anthropic旗下的Fable 5完成。与此前相比,这种模型组合成本更低,效率却明显提升。
一位大厂员工也告诉记者,目前较为流行的一种用法是,用Opus负责规划,然后把执行交给Sonnet,甚至Haiku去完成。因为像Opus这样的模型确实非常昂贵,消耗也很快,所以公司接入了不少更便宜的模型,其中就包括DeepSeek,内部已有很多人开始使用。
“此前国产大模型的成本优势,主要来自模型推理精度、MoE结构、相对较小的模型体量以及稀疏机制等模型本身特性。”上海财经大学特聘教授胡延平告诉记者,未来国产模型需要形成不同速度、不同能力水准、不同模态、不同功能的模型梯度与组合,进而形成差异化成本结构,并结合分时、分层等精细化运营机制,提升整体营收能力。
对于企业客户来说,真正需要计算的成本,并不是“每个Token多少钱”,而是“每完成一次任务要花多少钱”。刘震认为,面向企业级用户,大模型竞争的核心维度正在从单纯的智能水平排名,转向任务完成质量与任务成本之间的平衡。
例如,Kilo Code于2026年6月发布的一份测试研究显示:基于开源大模型的任务解决测试,每次平均成本为0.22美元,成功率为46.7%;而Claude Opus 4.8、Sonnet 4.6和GPT 5.5的每次平均成本为0.79美元,成功率则达到65.6%。这意味着,如果把成功率因素也纳入计算,两者的真实成本差距并没有想象中那么大。
怎么赚钱?
最近,DeepSeek计划陆续通过分时定价、V4 Pro正式版提价等方式,提升整体价格水平。这也引发了一个关键问题:国产大模型依靠极致性价比建立的优势能否长期持续,未来又该如何转化为真正的商业成功。
“DeepSeek此前的低价策略,带有阶段性促销和通过补贴扩大用户规模的考虑。”胡延平认为,国产模型与美国模型之间的价格差,也与市场基础、用户支付能力、用户付费习惯等因素有关。如果国产模型价格大幅上涨,将明显影响其市场导入速度。
尽管在行业声量上,国产大模型已经开始挑战OpenAI、Anthropic等公司的闭源模型,但如果从营收角度来看,双方仍不可同日而语。
今年5月中旬,Anthropic公布的ARR(年度经常性收入)为470亿美元。此后,Anthropic未再公开最新ARR数据。第三方数据公司TickerTrends在7月中旬对Anthropic的ARR估算为741亿美元。华尔街甚至猜测,到2027年底,Anthropic的ARR可能达到4000亿美元。
OpenAI的ARR增长一度较为缓慢。不过在今年7月底,OpenAI高管在内部会议中宣称,7月的ARR“已经超过了整个二季度之和”。
相比之下,中国模型公司如月之暗面,其ARR在2026年3月首次突破1亿美元,5月达到2亿美元,6月站稳3亿美元关口,3个月内增长了3倍。其中,API收入已占公司整体收入的七成以上,并且仍在持续提升。
刘震认为:“智谱、月之暗面等中国初创模型公司,与美国模型公司C端营收占比七八成、再去寻找B端市场增量的路径不同。像API已经成为Kimi的主要业务,其实它基本上已经放弃了C端市场。”
他表示,这与中国互联网流量环境密切相关。在国内,流量入口掌握在互联网巨头手中,任何初创公司想要获取流量,曝光成本都非常高。比如月之暗面在融资初期曾一度大量投入,希望把月活做到3000万级别,但后续投入的可持续性与效果都存在疑问,这也是“六小虎”纷纷退出C端市场的重要原因之一。“目前国内大模型C端用户拓展做得比较好的,只有字节跳动的豆包,以及阿里巴巴的千问和夸克。如果C端用户规模有限,更多公司只能依靠企业API调用来实现收入。”
这也是为什么市场会对中国大模型在美国企业市场打开一定空间感到兴奋。一位投资人向记者直言,像智谱的月活只有百万级,如果只看C端用户规模,其实很难支撑其市值预期。
当前,的确已有更多全球大型企业开始使用中国模型。比如微软就向媒体证实,正在探索将经过微调并部署在Azure上的DeepSeek V4版本,作为Copilot Cowork的低成本模型选项,以替代目前由OpenAI和Anthropic模型承担的部分工作负载,同时把该产品从固定收费改为按用量计费。西门子、Airbnb等企业也公开表示,正在使用DeepSeek、千问等中国大模型。
刘震认为,中国模型还没有成为美国企业,尤其是大型企业的主流选择。“大企业采购大模型时会受到很多因素制约,不只是看性价比,还要考虑模型运行是否稳定、数据是否安全等问题。比如前段时间Kimi K3就出现过宕机,这意味着企业硬件能力可能无法完全匹配。企业在采购模型时,会把这些问题都纳入考量。中国模型公司进入美国核心模型市场,目前仍处于初级阶段。”
一位在全球布局业务的初创企业负责人告诉记者,国产大模型当前的能力边界其实比较清晰,例如中文、英文能力较强,但在其他语种上的表现仍有欠缺,而这些细节正是大模型出海无法回避的问题,“性价比只是中国大模型出海的起点”。
发于2026.8.17总第1248期《中国新闻周刊》杂志
杂志标题:中国大模型,“卷”到海外
记者:陈惟杉
编辑:闵杰
