游乐游手机版
首页/AI热点日报/热点详情

商汤首提TPW:重新定义AI基础设施效能标尺

类型:热点整理2026-08-15
如何在有限能源与可控成本下,产出更多Token?这是Token经济时代下,AI基础设施与AIDC(人工智能数据中心)正在共同面对的新课题。随着Token消耗呈指数级增长,算力需求不断攀升,AIDC用电量在全社会用电结构中的占比也快速提升。行业关注AIDC的重点,已经不再只是“谁拥有更多算力”,而是进

如何在有限能源与可控成本下,产出更多Token?这是Token经济时代下,AI基础设施与AIDC(人工智能数据中心)正在共同面对的新课题。

随着Token消耗呈指数级增长,算力需求不断攀升,AIDC用电量在全社会用电结构中的占比也快速提升。行业关注AIDC的重点,已经不再只是“谁拥有更多算力”,而是进一步转向“谁能以更低成本、更高效率,持续生产更多高质量Token”。

在商汤大装置智算中心总经理林海看来,进入Token经济时代后,AIDC需要被重新定义为连接电力与Token的价值平台。算力与电力能够协同优化到什么程度,正成为决定未来AI基础设施商业竞争力的关键变量。

商汤大装置首提TPW,重新定义AI基础设施效能标尺

【商汤大装置智算中心总经理林海】

01 Token经济下,只看PUE为什么行不通了?

AI基础设施效率究竟该如何衡量?又该怎样持续优化?在很长一段时间里,行业给出的答案都是PUE。作为数据中心总能耗与IT设备能耗的比值,PUE长期被视为衡量数据中心能效的“黄金标准”。过去十多年里,行业几乎所有节能优化动作都围绕PUE展开:从机房气流组织优化,到制冷系统架构升级;从自然冷却利用,到液冷技术规模化落地,每一轮改进的目标,都是让PUE进一步降低。

但如今,AIDC的服务模式正从“卖卡时”逐步转向“卖Token”。当业务的计量单位发生变化,效率评价的核心标尺也必须同步升级。PUE更关注“消耗了多少电”,却无法回答“这些电最终产出了多少有效价值”,这正是当前AIDC行业普遍面临的认知缺口。

根本原因在于,在现有产业分工体系下,电力投入与Token产出的“数据链路”长期处于割裂状态。

四层分工彼此独立、各自优化本环节指标,结果往往难以实现真正的全局最优。

更深层次的问题在于,传统的效率衡量工具本身就不够完整。PUE下降,并不天然意味着总能耗一定下降,更不代表Token生产成本会同步降低。林海举了一个典型例子:如果把送风温度调高,确实可能降低制冷环节能耗,使PUE账面数据更好看;但与此同时,GPU与服务器风扇功耗往往会上升,最终整体用电量未必真的减少,甚至Token产出成本还有可能不降反升。

既然PUE无法准确回答“这些电究竟创造了多少价值”,那么行业就需要一个新的效能衡量标准。

02 从PUE到TPW,重构AIDC的效能标尺

基于这一判断,商汤大装置提出了一项全新的效率指标:TPW(Tokens Per Watt)。该指标以单位电力成本所产生的有效Token为核心,统一衡量算力效率、能源效率与业务价值。

简单来说,PUE衡量的是电力使用效率,而TPW进一步回答的是:每一度电最终产出了多少有效Token。同时,TPW还将分时电价等经济性因素纳入评价体系,推动行业关注重点从“用了多少电”,升级为“这些电形成了多少有效产出”。

TPW并不是对PUE的简单否定,也不是完全替代,而是在PUE基础上,进一步打通从电力投入到Token产出的全链路效率评估。过去分散在不同环节的优化动作,包括电价、储能、PUE、GPU利用率以及模型效率等,也由此开始统一指向Token产出这一核心价值指标。

商汤大装置首提TPW,重新定义AI基础设施效能标尺

对于行业而言,TPW的意义不止是新增了一个指标,更重要的是建立了一套统一的价值语言。电网、IDC、算力平台以及模型厂商,都可以在同一套效能标尺下进行结果优化。由此,算电协同也从概念走向可度量、可复制、可商业化的系统能力。

03 算电协同如何实现系统级效能优化

有了新的评价标尺,接下来的关键问题就是:如何让AIDC在既定供电条件下产出更多Token?

商汤大装置给出的答案,并不是单纯增加算力资源或扩容电力,而是通过算电协同Agent,对算力任务、能源供给与基础设施进行统一编排和智能调度,充分释放分时电价、需量控制以及需求响应中的时间价值,让每一度电发挥更高效率。

这套方法路径主要分为数据贯通、任务调度和算电协同三个层面:

第一步:打通数据,建立可观测底座

实现优化的前提,是先做到可观测。

在传统IDC中,电力系统主要关注楼栋、机柜、服务器等物理设备,而算力平台则关注Job、Pod、Node等云原生任务,两套体系长期独立运行,因此很难回答两个核心问题:究竟是谁在用电?这些负荷是否具备调度空间?

为此,商汤大装置构建了八级数据穿透体系,打通任务、算力资源与物理用电之间的映射关系,将GPU利用率、任务功耗、机柜负荷、楼栋用电等关键数据统一到同一时间轴和观测体系中,实现每一度电与每一个算力任务的精准关联,为后续预测、调度和优化提供统一的数据底座。

商汤大装置首提TPW,重新定义AI基础设施效能标尺

商汤大装置智算中心运维总监张煦介绍:“在临港AIDC的监控大屏上,这种映射关系已经转化为实际运行能力。任务实时功耗、节点GPU利用率、机柜及楼层负荷、楼栋IT功率与进线侧用电数据,都被纳入同一条观测链路,实现了每一度电的流向与产出都可追溯。”

第二步:任务分级,释放资源弹性

当数据真正打通后,系统级优化才会真正开始。

商汤大装置并不是简单地迁移任务或增加硬件资源,而是依据不同任务的时效性要求,对算力资源进行智能化调度。

例如,在线推理等实时业务必须即时响应,而训练、评测、批处理等任务通常拥有分钟级、小时级甚至跨日的调节空间。系统会根据业务优先级与延迟容忍度,自动将部分可调度任务安排在低电价、低负荷或资源更充裕的时间段执行,在保障服务质量和业务SLA的前提下,提升整体资源利用效率。

这种优化方式并不会直接减少总用电量,而是通过优化任务时序,更充分地利用空闲资源和电能,让相同容量、相同电量产出更多有效Token,从而持续提升TPW。

第三步:多维协同,放大负荷弹性价值

在此基础上,商汤大装置进一步结合容量挖潜、储能调度与电网需求响应,实现算力与能源的动态协同。通过负荷预测、容量优化和储能削峰等手段,充分释放既有基础设施的资源潜力,在不新增供电容量的前提下,让有限电力承载更多有效计算任务。

张煦提到:“实测数据显示,在既有供电条件下,IT有效承载能力可提升约60%。这一提升并非来自新增供电容量,而是依靠系统级协同,让同样的MW容量承载更多有效计算,从而持续提升AI基础设施整体算效。”

商汤大装置首提TPW,重新定义AI基础设施效能标尺

【商汤大装置智算中心运维总监张煦】

04 临港AIDC实践:算电协同走向规模化验证

目前,这套方法论已经在商汤临港AIDC完成了规模化验证。

在今年7月10日上海市迎峰度夏电力需求响应中,商汤临港AIDC率先启动算电协同调度模式,实现午间常规用电负荷削减75%,可调负荷规模达到23MW。通过非关键任务暂停、基础设施降耗、储能放电等算力与电力协同措施,在两小时内向电网释放了4.6万度削峰电量。

这意味着,AIDC与电网之间的关系正在发生深刻变化。过去,智算中心更多被视为需要重点保障的刚性负荷;而如今,当算力任务能够被识别、分级并实现智能调度后,负荷弹性就成为一种可运营、可调度的新型资产。算力任务可以依据业务优先级灵活安排执行时机,储能系统、算力资源与电网需求也能够形成联动,共同参与电网需求响应。

从PUE走向TPW,AI基础设施优化的已经不只是单一设备能效,而是整个算力系统的运行效率。商汤大装置释放的,也并非新增算力或新增电力,而是隐藏在任务弹性、资源调度与能源协同中的系统级效能。

05 算电协同Agent:让TPW真正落地的智能调度系统

TPW不仅是一套新的效率衡量标准,更需要一套能够持续提升TPW的智能化系统来支撑落地。

基于商汤多年智算中心运营实践,商汤大装置打造了算电协同Agent,构建出一个会感知、能思考、可决策、可执行、可持续进化的智能调度系统。不同于传统能源管理平台仅聚焦电力侧,算电协同Agent能够同时连接算力、能源与业务,实现全链路协同优化,让每一度电持续创造更多Token价值。

商汤大装置首提TPW,重新定义AI基础设施效能标尺

在能力架构层面,算电协同Agent依托八级数据穿透体系、五大智能决策链和六大运营能力,打通任务、算力、能源与基础设施之间的数据壁垒,形成从感知、预测、决策、执行到度量的完整闭环。系统不仅能够实现负荷预测、电价分析、储能优化、容量控制、暖通协同、算力调度等智能决策,还以TPW作为统一优化目标,将过去分散在不同系统中的优化动作统一到同一套效率框架之中。

目前,算电协同Agent已全面应用于商汤临港AIDC,实现单位电力成本Token产出提升80%、平均电费单价较同地区IDC低约10%、算力负荷预测准确率达到96%。

商汤大装置智算中心运维总监张煦介绍,为了让这一能力复制到更多智算中心场景,商汤大装置算电协同Agent采用平台化、模块化设计,将多年运营经验沉淀为可复用的Agent能力,并依托FDE(Field Domain Expert)专家体系形成标准化交付流程,新场景最快一周即可完成部署上线,实现算电协同能力的快速复制与规模化落地。

对于国家算力枢纽节点、万卡级智算中心等大型AI基础设施而言,算电协同Agent能够统一调度算力、能源与储能资源,提升集群整体算效,并优化绿电消纳能力和综合用能成本。

对于算力运营商、AI云服务商以及Token工厂,系统能够结合电价预测、负载优化与算力调度,持续降低单位Token电力成本,在保障业务SLA的同时提升资源利用率与运营收益。

对于企业级智算中心、科研机构以及行业AI平台,依托模块化架构和标准化交付体系,客户无需重构现有基础设施,也能快速部署算电协同能力,构建更加智能、高效、绿色的智算中心运营体系。

在商汤大装置智算中心总经理林海看来,从PUE迈向TPW,变化的绝不只是考核口径,更是整套AI基础设施的运行逻辑。接下来,算电协同也不会只停留在智算中心“节能工具”的层面,而将成为打通算力、能源与业务的关键能力。商汤大装置希望借助算电协同Agent,将系统优化能力进一步标准化、产品化、规模化复制,推动AI基础设施正式迈入系统级算效时代。

商汤大装置首提TPW,重新定义AI基础设施效能标尺

来源:https://www.leiphone.com/category/ai/XzQc2DEYciB5M57I.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。