先说几个基本判断:AI的价值,终于不再靠“卖了多少许可证”这种老黄历来说话了。
过去十年,软件行业衡量一款产品成不成功,标准很统一——采用率。卖了几个席位?有多少活跃用户?续费率涨没涨?这些指标在消费级软件的世界里,是铁律。但到了AI时代,这套量具开始失灵了。理由很简单:AI不卖座位,它“干活”。真正有效的刻度,是模型实际完成了多少项可交付的工作。
这正是OpenAI在7月17日发布的那篇深度长文里,直面企业领导者最核心的经济命题:人工智能所完成工作的价值增长,是否跑赢了其生产成本的增长?
关键问题来了。要回答这个问题,光盯着“每token成本”显然不够。一个低价模型,token单价确实便宜,但如果输出质量不稳定,经常需要反复调用、耗时拉长、人工审核激增,那这笔账算下来,恐怕比高价模型还贵。而一个高价模型,token单价高,但可能一次命中目标、零返工交付。真正的成本,是产出一个合格结果所需的全链路代价,并以此对标该成果所创造的实际价值。
所以,OpenAI干脆推出了AI时代的终极衡量标准——每美元产生的有用智能(Useful Intelligence per Dollar)。这个指标,聚焦四个关键维度:AI是否在执行真正有意义的任务?完成一项高质量任务的实际成本是多少?用户能否持续信赖其输出?随着使用规模扩大,每一美元AI投入,是否持续撬动更多价值?

维度一:到底完成了多少“有用工作”
价值只在token转化为人类可直接使用的实际产出时,才被真正激活。模型能力越强,所能承载的任务就越长、越复杂:它能维持上下文连贯性、执行多步逻辑推理、跨工具协同操作,并在过程中动态校准自身行为。最务实的落地路径,是锚定一个具体业务流程,明确定义“完成”的标准,再在其真实运行的系统中进行量化追踪。
举个例子:对客服团队而言,“完成”意味着客户问题彻底闭环;对研发团队,是一次通过全部测试的代码提交;对法务部门,则是一份准确、及时且合规完成审查的合同。OpenAI以财务团队准备预测评审为例:在最终决策前,需调取最新预测数据、导入Excel或Sheets、识别关键变动、核对各标签页、重建演示幻灯片、逐项验证数字一致性——这些琐碎却耗时的环节,如今大半可由ChatGPT Work自动承接。团队由此得以抽身,专注思考更具战略意义的问题:变化的本质是什么?驱动因素何在?后续应如何应对?这才是每一美元在现实场景中兑换出的“有用智能”。
维度二:单次成功任务的真实成本
AI任务的成本差异巨大。一句即时问答消耗极低算力,而编程、研究、财务类任务往往涉及深度推理、工具调用与密集交互,既吃资源,也产高价值。在模型层面,单次成功任务成本由定价、实际计算消耗及首次正确率共同决定;对企业而言,还需叠加员工时间、人工复核、重试开销与返工损失。
算法极为简洁:将完成某类工作的总成本加总,除以达到质量门槛的任务数量。这也解释了为何“每token最低价”未必等于“每结果最低成本”——即便面对常规请求,若前沿模型能一次性给出精准答案,节省下来的重试次数、等待延迟、审核人力与整体算力消耗,反而使其成为最具性价比的选择。
OpenAI最新推出的GPT-5.6,正是基于这一逻辑构建的三层架构:Sol为旗舰级,Terra兼顾性能与成本平衡,Luna则主打极致响应速度与资源效率。这套分层设计为企业优化投入提供了起点,但最终选型必须回归任务本身的经济性——高吞吐流水线适配Luna,中等复杂度任务优选Terra,而当更强推理能力可显著减少尝试轮次并提升最终质量时,Sol便是最优解。在训练GPT-5.6过程中,核心目标正是让每个token产出更多可用成果:在Artificial Analysis编程智能体评估中,启用最大推理能力的GPT-5.6 Sol刷新历史最佳成绩,同时比另一款头部模型减少54%的输出token;在DeepSWE v1.1长周期工程任务测试中,GPT-5.6 Sol达成72.7%的新纪录,超越Claude Fable5的69.9%,预估API成本亦降低36.2%。每一代模型的进步,都应同步体现在两方面——更高效率让既有任务更便宜,更强能力则让全新类型的工作成为现实。
维度三:可靠性——AI正确完成任务的频率
AI的落地通常遵循渐进式深化路径:从辅助草稿起步,逐步发展为在工具与数据间自主构建上下文、开展推理,最终迈向主动执行、异常处理与端到端流程接管,而人仅在关键节点介入判断与控制。每一步跃迁都释放更大价值,也对系统提出更高要求。
可靠性本身就是真金白银。当输出准确、来源可信、前后一致、且能恰当地识别边界并升级处理,人们花在核查、修正与返工上的时间便大幅压缩,单次成功任务成本随之下降,组织也更有信心将AI嵌入更高价值的核心流程。
OpenAI建议团队追踪三类结果来衡量可靠性:可直接交付使用、需少量修正后使用、需人工介入升级处理。这类分类比单纯的模型准确率更能反映AI是否切实减少了完成项目所需的人力投入。可靠性还需明确的能力边界:在AI从“起草者”向“执行者”演进之前,组织必须清晰界定其可访问的数据范围、可调用或修改的系统权限、以及哪些操作必须触发人工复核或审批。安全、保障、隐私与可控性,构成了深度应用的基石。而ChatGPT Work,正是构建于ChatGPT Enterprise的安全架构、合规框架与工作区管理体系之上,使组织在保持全程监督的前提下,放心赋予AI接入高价值业务流程的权限。能力带来初次尝试,可靠性才让AI真正成为“完成工作”的一部分。
维度四:规模化价值——每美元投入能否驱动更多有效产出
企业可通过长期追踪同一工作流来量化这一趋势:统计达标任务数、总投入成本,以及单次成功任务的平均成本。若完成的工作量增速持续高于总成本增速,且质量稳定甚至提升,则意味着每单位资金正产出更多价值。
算力,正是这个等式的核心引擎——它既支撑着前沿研究,也驱动着AI每一次任务的执行,直接影响产品质量、响应速度、系统可靠性、服务可用性与综合成本。训练算力塑造未来能力,推理算力兑现当下价值,二者最终都要落脚于更优的客户成果。
更先进的模型、更高效的推理架构、专用硬件加速、更高的资源利用率、更智能的流量调度机制,以及更贴合场景的产品设计,都能显著提升算力的投资回报率。客户则从体验端直观感知这些进步:答案更精准、响应更迅捷、修正更稀少、产品更稳健、完成同等任务的成本更低。这些收益具备自我强化效应——更优质的基础设施加速模型研发,更强更高效的模型反哺产品进化,产品升级推动更广adoption、更深层学习与更可持续的收入增长,进而支撑新一轮研究投入、算力扩容、部署优化与安全保障建设。OpenAI以统一智能平台整合所有要素:终端用户通过ChatGPT与ChatGPT Work触达能力,开发者依托Codex与API进行定制开发,企业则将其无缝嵌入真实业务发生的系统之中。任一层面的改进,都将同步惠及所有产品形态与客户群体。
将上述四项指标统合起来,这张记分卡本质上是在回答一个根本问题:单位成本所换取的“有用智能”,是否持续向上攀升?
有用产出揭示AI能创造什么,单次成功成本说明达成目标需付出什么,可靠性体现成果可被信任的程度,规模化价值则验证随着时间推移,每一块钱、每一瓦算力是否持续撬动更高成效。OpenAI将自身使命凝练为一件事:让这个等式在每一代模型迭代中不断优化——打造更强模型、交付更快更稳的结果、并为客户真实所需的任务持续压降综合成本。
当AI开始用“每美元的有用智能”发声,而非沉溺于token的流水账,所谓“价值”,才算真正被厘清。
