
数据中心向来是能耗大户。一方面,行业不断努力降低电子设备功耗,避免总功耗持续上涨;另一方面,为实现冗余备份,分配给数据中心的供电容量会高于其标称实际所需。
在当前对数据中心供电问题的研究中,这两大问题交织在一起:既要降低器件功耗,又要提升供电资源利用率。" 闲置功耗无疑是系统中最大的电力消耗源。" 楷登电子负责设计 IP 产品营销的副总裁 Arif Khan 表示。出现该现象,一部分原因是部分服务器运行电压高于实际需要,另一部分原因是电力被预留作为备用。
其他业内人士也持相同观点,并指出闲置功耗,也称作搁浅电力(stranded power),其影响正日益凸显。" 如今客户会更公开地讨论该问题,尤其是大型数据中心,微小的效率损耗累积起来会非常可观。"Rambus 院士、杰出发明家 Steven Woo 说道。" 不同工作负载对资源的使用模式各不相同。有时资源配置过剩,有时又配置不足。如果数据中心按照所有资源都达到或接近满负载来规划,资源配置过剩就会产生搁浅电力。而资源配置不足时,部分资源满载、其余资源闲置,同样会造成搁浅电力。"
可以通过智能功耗架构、监控性能并微调电压(保证满足性能前提下使用最低电压)来实现降功耗。降低功耗可以提升效率,但同时也会让预留的供电容量闲置不用,拉低电力利用率。业界正在研究新技术,目标是把这些富余的供电资源利用起来。
从节能架构着手
任何没有实际功能,但仍在接收时钟信号、持续耗能的电路,都会损害功耗效率。绝大多数定制芯片设计都会考虑采用节能手段来处理该问题。
闲置功耗一大重要来源是 IP 核及其接口,这部分细节不在集成方的掌控范围内。IP 属于外购模块,因此集成方必须充分了解该 IP 具备哪些节能手段,并加以利用。
" 站在 IP 的角度,很大一部分工作在于控制哪些接口休眠、哪些接口唤醒,以及启用哪些通道。"Khan 说。" 随着传输速率提升,这些接口的功耗越来越高,因此业界大量研究功耗优化状态以及功耗感知事务。现在已经具备多级待机模式。可供权衡选择的方案变多,但这需要操作系统与调度逻辑熟悉这些选项。举个例子,系统同时运行多个任务,即便某一个任务没有使用某个接口,别的任务可能正在使用,因此接口只能降到所有任务共同允许的最低功耗状态。"
部分 IP 的一些功能可以编译移除,例如带宽超出实际需求的接口。这种情况下该功能不会流片到芯片硬件上。但还有部分功能会保留在硬件中,IP 一般会支持切换多种功耗状态、调节时钟频率或是供电电压。
以 AMBA 总线为例,它提供低功耗接口(LPI)端口用于接口功耗管理。其中 Q 通道用于简易时钟门控与电源域控制;P 通道则面向多功耗状态场景,实现更高级的电源管理。通道的控制粒度决定了它能够管控多少电路。
时钟门控可以在不断电的前提下关闭电路。而电源门控的开关、重启恢复都需要更长时间。
" 我们需要把电路功耗降到尽可能低。"Khan 表示," 但另一面是电路唤醒恢复,需要权衡恢复时间与功耗收益。"
动态电压频率调节(DVFS)是另一种成熟的运行状态调节手段,系统会根据温度或其他条件选用不同的频率、电压配置。芯片也可以接收外部信号,由软件等外部组件根据芯片外部条件设定工作状态。
但就影响力而言,没有哪类 IP 能够比得上片上网络(NoC)。" 片上网络是 SoC 的骨干网络,我们必须搭建完善的电源管理方案,才能实现整个芯片的节能。"SignatureIP 销售与业务发展高级副总裁 Ewald Liess 说道。该公司在 AMBA 接口上大量使用时钟门控与功耗状态管理。" 每个集群内部都有独立时钟驱动。典型 5+5 节点配置下包含 10 路独立门控时钟。此外,片上网络的每个节点都具备功耗状态,休眠 / 运行事件会通过 P 通道完成协商。"
每颗芯片都存在个体差异
理想情况下,功耗架构及其运行策略,对同一颗芯片的各个模块影响应当完全一致。但现实中,不同芯片的工作特性各不相同;即便是同一颗芯片,使用数年后的表现也会和刚出厂时不一样。因此上面提到的架构与电路设计技术,都必须预留裕量,保证芯片在全生命周期内都能够符合规格。
" 功耗与电压的平方成正比。"proteanTecs 系统部门副总裁 Noam Brousard 说道。" 但器件施加的电压,是按照最坏工况来确定的。严苛的工作负载、系统与环境条件,再加上长期使用带来的器件老化,都需要更高电压来维持性能。然而,所有这些恶劣条件几乎不会同时、持续出现。"
芯片老化就是一个典型例子。硅器件损耗问题过去很多年都被行业忽视,但如今已经成为重要性能考量点。芯片的裕量设计,必须同时兼顾刚出厂以及预期寿命末期的工作表现。所以供电电压要设置为芯片老化之后依然可以正常工作的数值。该电压通常高于全新芯片的实际需求。" 举例来说,老化需要提高电压做补偿,但芯片刚启用的第一天还没有产生老化效应,并不需要这么高的电压。"Brousard 说。" 另外,即便芯片运行温度很高,当下实际的工作负载对器件的压力也可能并不大。"
片内监测技术为此提供了更高的电路运行灵活性。芯片在测试阶段完成特性标定,确定自身所需电压。之后实时监测系统就可以在确认性能达标的前提下降低电压。" 我们可以实时测量芯片内部逻辑距离失效的实际裕量。"Brousard 介绍。" 各类损耗效应累积到一定程度,器件就需要更高电压才能满足规格,而这些裕量可以直接反映该累积效应。凭借这一观测能力,系统可以随时根据芯片当下实际需求动态优化电压。当不需要预留裕量时就释放掉这部分开销,芯片以显著更低的电压运行,同时满足工作要求。只有当恶劣工况出现时,才提升电压来应对新的需求。"
虽然降功耗有诸多好处,但有时也需要提升功耗。" 如果运行在很小的裕量下,一旦工作或环境条件突变,就会立刻需要更高的工作电压。"Brousard 说。" 例如负载突然变化带来动态电压跌落(Ldi/dt 效应),会威胁数字逻辑的时序完整性。"
针对这类场景,proteanTecs 设计了一套硬件 " 安全防护机制 ",主机系统可以在几个时钟周期内识别裕量骤降问题并进行缓解。手段包括时钟分频、降频,同时重新把电压调整至安全水平,之后再恢复时钟正常运行。
更重要的是可以持续监测芯片老化状态:芯片初期可以降低电压节能,在生命周期中随着老化程度加深再适时抬升电压。
数据中心刻意预留超出实际使用的供电
上述所有节能技术都可以降低数据中心整体能耗,这是有利的,但之后会产生新的问题。数据中心会配置固定的供电容量,高效率的另一面就是利用率。如果没有用尽全部供电容量,理论上可以接入更多设备。新增设备固然会带来采购成本,但相比新建数据中心、或是在现有站点扩容供电,成本要低得多。
" 供电资源获取,是制约数据中心运营商业务开展的最大因素之一。"Utilidata 首席技术官 Marissa Hummon 表示。" 如果想从变电站新架设一条输电线路到园区,成本高昂、周期漫长,还需要办理大量许可、遵守各类法规。就算在园区内部新建发电设施,审批也需要耗费不少时间。"
当然,节能会降低电力利用率,但闲置电力的主要成因并不在此。数据中心必须保障可靠性,杜绝停机事故。供电线路有可能发生故障,因此数据中心通常会超配供电,当某一路供电失效时,可以从其余正常线路调配电力。
有一种常见方案叫做 3 4 架构(常称作 " 三供四备 "):需要 3 路 100% 负载能力的供电,额外增加第 4 路作为备份。4 路供电平时均按照 75% 负载运行;一旦一路故障,剩余 3 路可以承担全部所需的 100% 负载。除此之外还有 4+2(2N 系统的一种)、n+1(比实际需求多一路供电)等架构。
" 英伟达推荐采用三供四备或者 n+1 架构,而很多传统老旧数据中心会直接使用完整 2N 双路供电架构。"Hummon 说。" 也就是两路供电进线,两路都运行在 50% 负载;一旦其中一路故障,另一路可以接管全部负载。"
即便到现在,冗余供电的容量大多处于闲置状态。" 数据中心为这部分容量支付了费用;电力公司也投入资本建设配套设施,但闲置容量对应的千瓦时电量并没有实际售出。"Hummon 解释道。" 某站点总供电配置可达 2 吉瓦,但采用 2N 架构之后,站点管理人员实际可用视作 1 吉瓦。而在这 1 吉瓦里面,通常目标利用率只有 70% 80%。整体算下来,最终给到计算基础设施的电力大约只有 2 吉瓦总容量的三分之一。"
如果故障发生时把闲置的富余电力全部用上,故障后剩余供电线路将不足以承载全部业务负载。以 3+1 架构举例,若所有线路都跑到 90% 负载,一旦一路故障,剩下三路就需要承担 120% 的额定负载,业务必然无法全部保障。但大家还是希望能够正常情况下利用富余供电,同时故障时可以完成容灾切换。
系统供电监测
要解决这个问题,一个合理思路就是实时监测供电状态;一旦某路供电故障,就缩减业务规模,适配剩余可用电力。但实现难度很高。正在运行的任务需要取消调度或者设置检查点,避免供电下降后任务出错。短期应急手段是降低电压与时钟频率,把总功耗压降到故障后供电可以支撑的水平。这就需要实时监测与快速响应,这正是 Utilidata 所解决的问题。

" 发生停电之前,系统会出现一些瞬态特征,预示故障即将到来。"Hummon 解释。" 当我们预判故障将至,就会向具备弹性伸缩能力的任务发送信号,要求业务降负载。假设 2N 架构系统原本运行在总容量 70%,故障来临前只需要削减 20% 负载,就回落至 50% 安全水平。"
该公司采用两套控制环路。第一套面向工作负载调度器。"AI 工作负载动态性极强,调度需要全局掌握供电、内存与计算资源情况。"Hummon 说。" 我们向调度器输出信号,以此改变 GPU 之间的任务分配策略。" 这套环路的响应时间较长,任务的调度、撤销会受当时计算进程状态影响,逻辑复杂。" 我们本身并不直接调度或者终止任务。"Hummon 说明," 我们可以输出每个机柜 / 机排 / 机房的供电容量预测,以此影响调度器。调度器以秒级运行,因为迁移推理任务需要清空正在处理的请求,再把模型权重加载到其他计算实例。"
第二套控制环路响应速度更快,管控本地供电,也可以直接调节处理器芯片内部功耗。" 另一套控制环路直接对接服务器。"Hummon 说," 我们对接 DVFS 信号,也叫功耗上限接口,可以实现毫秒级的功耗调整。"
DVFS 的控制也并非直接操作硬件。" 我们的技术通过服务器标准接口读取数据、下发动作。"Hummon 介绍。" 英伟达管理库获取 GPU 功耗状态;基板管理控制器 BMC 获取服务器整机功耗与遥测数据。这些控制接口会下发到执行 DVFS 的固件。我们把接口和行为纳入机柜级功耗优化。单纯依靠服务器本地控制,只能估算所有服务器汇总的机柜交流功耗,而我们可以实现每秒百万次采样的直接测量,消除估算带来的误差。"
借助这套技术,正常工况下可以使用超配出来的富余供电;一旦出现故障,还能有序地降低负载。" 如果具备这套动态系统,四路线平时负载甚至可以跑到 95% 98%。"
采用该方案后,数据中心就可以接入更多服务器。理想情况下,满功率丢失的情况持续时间短、发生频率低,就可以获得可观的新增算力供电。对于 2N 架构,相当于实际可用供电近乎翻倍。
安全成为功耗控制的一环
但如果安全防护不到位,这套能力也会成为新的系统攻击入口。" 安全性从项目一开始就是设计要求。"Hummon 表示。" 我们符合 SOC 2 服务组织控制规范,同时我们的 Karman 监测系统正在申请 IEC 62443 4 2 工业控制系统安全认证。AI 数据中心的每台服务器都自带可以设置功耗上限的 BMC,每一个 GPU 主机也都向高权限进程开放功耗限制接口。大规模调节功耗的硬件能力本就存在于网络之中。我们只是把分散各处的接口做协同,因此控制单元本身属于高价值攻击目标。我们采用安全启动、硬件信任根,仅允许运行我方签名固件;设备对外的全部接口启用双向身份认证,杜绝未授权指令控制功耗。整套控制环路全部本地运行,不依赖互联网连接。"
效率与利用率的交汇点
大家很容易认为,每个器件都实现节能,整体总能耗就会随之下降。但现实并非如此。单纯降低器件功耗,会拉低电力利用率。利用率变低,就意味着有供电资源闲置,本可以用来承载更多业务、创造更多收益。
芯片设计人员不断探索用更少能量完成更多计算。而如今,数据中心运营商也获得了新手段:在既定供电容量内承载更多业务,当然前提是受机房物理空间限制。这种趋势还会持续下去,数据中心永远不缺待处理的业务,而这一局面短时间内不会改变。