拓冰建站拓冰建站
首页 / 资讯中心 / 正文

从PUE到TPW:AI基础设施效率逻辑正在改变

当大模型从技术探索进入规模化应用AI基础设施正在迎来一场关于“效率”的重新定义。过去数据中心主要围绕通用计算、存储和网络资源提供基础支撑PUEPower Usage Effectiveness是衡量基础设施能源效率的核心指标之一算力规模则更多用于衡量计算能力。但随着大模型训练、推理和Agent应用不断扩大智算中心正在从单纯承载算力的基础设施逐渐转变为持续生产Token的“AI工厂”。在这样的变化下仅仅关注机房消耗了多少电、部署了多少算力已经越来越难完整衡量一座智算中心的实际效率。电力经过基础设施和算力系统之后最终产生了多少有效Token以及这些Token以怎样的成本被生产出来正在成为新的效率问题。近日在华为全连接大会同期举行的华为AIDC基础设施峰会上商汤大装置智算中心总经理林海发表《商汤智算从PUE到TPW的效率演进》主题演讲提出随着AI进入Token规模化生产时代AIDC的效率评价正在进一步从基础设施能效向AI业务产出延伸。传统PUE关注“投入的电力有多少用于IT设备”而TPWToken Per Watt则进一步关注“投入的能源最终产生多少Token”。这并不意味着PUE将被TPW取代而是意味着AI基础设施的效率评价正在从基础设施本身进一步延伸到AI生产全链路。Token正在成为AI基础设施最直接的“产出”。商汤集团在2026年半年报中提出围绕“一套模型、一座Token工厂、一套智能体管控系统”构建核心能力体系。其中Token工厂以商汤大装置为基础设施底座通过AI原生云平台SenseCore将能源、算力、存储、网络、模型和应用等资源进行连接和调度持续降低Token生产成本、提高Token生产效率。目前商汤大装置日均Token服务量约为4.5万亿2026年全年Token量级预计较年初增长约25倍。当Token开始成为规模化生产的对象后智算中心的效率评价自然需要进一步向上延伸。PUE可以回答数据中心自身是否节能“多少P”可以反映部署了多少算力但二者都很难直接回答这些能源和算力最终创造了多少AI生产力这正是TPW试图补上的一环。从PUE到TPW效率评价从“机房能效”走向“AI生产效率”如果把AI基础设施看作一座Token工厂那么效率优化实际上贯穿从能源到应用的完整链路。最底层是电网、电厂和能源系统需要考虑电力来源、能源结构、供电稳定性和单位电量成本进入AIDC之后需要优化供配电、制冷、机柜以及整体基础设施架构服务器和芯片层面则涉及算子、显存、网络互联和并行效率再往上是模型训练和推理需要关注吞吐、GPU利用率以及模型本身的计算效率最终到了应用层还需要通过模型路由、弹性调度、闲时算力利用和推理优化等方式提升Token产出。因此AI基础设施效率越来越难以通过单一环节来衡量。这也是TPW与传统PUE最大的区别所在。PUE主要描述“数据中心消耗的能源有多少真正进入IT设备”而TPW进一步尝试把能源投入和AI业务产出连接起来即关注单位能源能够产生多少Token。而真正的难点也恰恰在这里AI基础设施不是一个个相互独立的环节而是一个高度耦合的系统。例如单纯提高机房温度可能降低制冷能耗、改善PUE但如果同时改变GPU运行工况导致服务器风扇功耗增加整体能源效率未必得到提升。类似地单纯追求GPU利用率也不一定意味着Token产出效率最高因为模型结构、通信效率、任务类型和调度方式都会影响最终产出。因此AIDC真正需要追求的并不是某一个指标的局部最优而是从能源进入到Token产出的全链路系统最优。商汤大装置正在围绕这一思路构建算电协同体系其算电协同Agent以“负荷→电价”“电价→储能”“储能→需量”“算力→PUE”“电价→Token”五条决策链为核心将能源、电力、储能、算力和业务负载进行联动并进一步把数据下沉至Job、Pod、Node、服务器、机柜及园区等不同层级。其核心逻辑已经不是简单地“降低电费”而是根据能源和算力状态动态调整AI任务让不同时间、不同成本的能源与不同类型的算力任务进行更精准的匹配。最终优化结果需要体现在Token生产上。商汤大装置披露的实践数据显示通过算电协同单位电力成本Token产出提升80%IT有效容量产出提升60%平均电费单价较同地区IDC降低约10%。从运营效率到建设效率AIDC本身也在走向更加灵活的架构如果说TPW和算电协同代表了AIDC运营效率的变化那么AI算力需求的快速变化也正在推动基础设施建设模式发生改变。商汤临港AIDC的基础设施演进正是这一趋势的一个缩影。从早期10kW机柜到20—25kW高功率机柜再到国产化超节点、液冷和模块化架构其基础设施持续随着算力密度和业务需求变化进行升级。其中一个18MW扩容项目更能体现这种变化。该项目需要快速部署48kW高功率机柜同时不能影响既有智算中心正常运营。针对这一需求商汤大装置与华为采用屋面集装箱化电力模块方案将供配电能力进行模块化集成并通过工厂预制方式完成交付。项目最终实现1.5个月交付全链路供电效率达到97.8%占地面积减少70%单套2.4MW电力模块预计每年节约20万度电电力侧CAPEX下降13%同时支持不停电在线维护及集中化智能运维。这一案例反映出AIDC基础设施正在从过去相对固定的建设模式向模块化、标准化、快速交付和弹性扩容方向演进。因此AIDC的效率不仅体现在运行阶段也体现在建设阶段——如何更快完成交付、更少占用空间、更低资本投入并能够持续适配下一代算力架构同样成为AI基础设施竞争的一部分。AI基础设施的竞争正在从“有多少算力”走向“创造多少有效产出”从PUE到TPW本质上并不是一个指标替换另一个指标而是AI基础设施正在经历一次效率评价体系的扩展。因此未来AIDC的效率可能越来越体现为一个多层次的体系底层看PUE中间看算力效率上层看Token产出最终看AI业务价值。过去数据中心更多承担“承载计算”的角色而在Token规模化生产时代AIDC正在成为连接能源、算力、模型与应用的生产基础设施。电力是生产投入算力是生产能力模型是生产工具Token是核心产出而应用则决定最终价值。这也意味着未来AI基础设施的竞争可能不再只是规模竞争而将进一步进入效率竞争一方面通过液冷、高压直流、储能、绿电、模块化供配电等技术持续提升基础设施效率另一方面通过异构调度、资源池化、模型优化和算电协同不断提升算力与能源的协同效率。商汤大装置也正在推进液冷规模化应用、高压直流供电、油机与储能联动、超导电缆以及绿电直连“零碳”园区等技术探索并联合中国信通院及产业链相关机构推动算电协同标准建设。从PUE到TPW变化的不只是一个指标而是整个AI基础设施对“效率”的理解从节约资源走向提升产出从优化单点走向全链路协同从建设算力走向建设真正能够持续创造AI价值的基础设施。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门