AI 对电力的巨大需求早已人尽皆知,但一个更隐蔽、更棘手的问题正浮出水面:数据中心用电量的剧烈波动正在损毁关键设备,威胁设施可靠性,并向整个电网输出不稳定风险。
据彭博 8 月 6 日报道,电池、发电机、冷却装置等 AI 计算设施的核心系统正因承受异常电力冲击而出现故障或提前报废。在 xAI 位于田纳西州孟菲斯的 Colossus 超算设施,燃气轮机已出现裂缝;英国多处规模较小的数据中心同样出现轮机开裂问题。部分已安装的稳压电池在高强度运行下,数周乃至数月内便需更换。
这一问题的市场影响正在显现。据报道,一位参与数据中心融资的知情人士透露,部分设施的实际运行时间已降至 80% 左右,远低于全年不间断运行的设计预期,若问题未能解决,未来 12 至 24 个月内将对相关项目投资者造成直接冲击。与此同时,北美电力可靠性公司(NERC)今年早些时候发出罕见的三级警报,要求大型数据中心立即应对电网稳定性风险。
电力波动的根源:GPU 集群的 " 毫秒级 " 冲击
AI 数据中心的用电模式与传统数据中心存在本质差异。传统设施的用电量相对平稳,而 AI 计算——尤其是模型训练阶段——会驱动数十万块 GPU 同步启停,用电量在毫秒级时间内大幅跃升或骤降。
Mainspring Energy Inc. 创始人兼总裁 Shannon Miller 将这一现象形象地描述为:一座相当于波士顿规模的 1 吉瓦数据中心,其中一半的用电量可能每隔数秒便闪烁开关。而德克萨斯州和美国中西部规划中的部分 AI 园区规模超过 5 吉瓦,平均用电量接近纽约市全市水平。
前特斯拉高管、Heron Power Electronics Co. 创始人 Drew Baglino 指出,AI 数据中心的瞬时用电量有时会飙升至设计容量的 50% 以上——" 一座 1 吉瓦的设施可能在瞬间消耗 1.5 吉瓦 "。其公司正为英伟达预计于 2027 年推出的下一代服务器开发电力波动管理设备。
Uptime Institute 英国首席顾问 Amber Villegas-Williamson 将这种冲击比作驾车时反复猛踩油门:
" 就像不断超速运转发动机,比匀速行驶磨损快得多。"
设备损毁已成现实:从裂缝到电弧闪络
据彭博采访的逾三十位美欧电力专业人士,AI 数据中心对物理设备造成的压力已有目共睹。
报道称,多位知情人士表示,数据中心所用小型天然气内燃机的曲轴已出现断裂。xAI 的 Colossus 设施中,燃气轮机出现裂缝,运营方随后安装电池以平滑电力波动、减轻轮机负荷。GeoPura Ltd. 首席执行官 Andrew Cunningham 亦证实,英国多处规模较小的数据中心同样出现轮机开裂问题。
UL Solutions Inc. 首席执行官 Jennifer Scanlon 指出,设备裂损或磨损可能引发电弧闪络——即电流在导体间跳跃——进而损毁 AI 芯片。
Uptime Institute 及多位业内人士表示,为稳压而安装的电池有时在数周乃至数月内便需更换。电池、电容器、变压器、飞轮等稳压设备虽已存在,但在抢速建设 AI 算力的浪潮中,新建数据中心对这些技术的部署明显不足。
值得注意的是,这一问题遍及全球,从中东、非洲到欧洲和美国均有出现。
可靠性下滑直击营收:每分钟损失可达数十万美元
设备损毁带来的直接后果是设施停机,而停机的代价极为高昂。
Switch 数据中心首席战略官 Jason Hoffman 表示,关键设备提前损毁的财务代价," 主要不是更换一个泵或断路器的成本,而是昂贵算力资产因离线而无法创造收入的损失 "。据估算,停机造成的收入损失从每分钟数千美元到数十万美元不等,因设施类型和工作负载而异。
据报道,一个具体案例是:为确保微软要求的 99.999% 可靠性,Joulent Inc. 与雪佛龙联合开发的德克萨斯州西部 2.67 吉瓦 AI 园区,不得不在工期中预留额外工程时间,供电启动时间因此从 2027 年推迟至 2028 年。Joulent 首席执行官 Chris James 表示,这一调整正是为了应对电力波动带来的工程挑战。
报道称,据一位参与数据中心融资的知情人士透露,行业普遍假设设施上线后将全年不间断运行,但现实中部分设施的实际运行率已接近 80%。若问题无法解决,未来 12 至 24 个月内将对相关项目投资者产生实质冲击。
分析指出,超大规模云厂商数千亿美元的资本开支已令投资者和贷款方神经紧绷。设备损毁加速折旧的问题,与此前市场对 GPU 机架折旧速度的质疑相互叠加,令外界对 AI 数据中心能否兑现其盈利承诺产生更深层的疑虑。
即便数分钟的停机,也会直接侵蚀数据中心开发商的营收。而若实际运行率长期低于预期,项目的财务模型将面临根本性重估。在 AI 基础设施投资热潮尚未退温之际,这一结构性风险正成为投资者不得不正视的新变量。
电网稳定性告急:监管机构发出罕见警报
值得注意的是,AI 数据中心的电力波动不仅威胁设施自身,还向更广泛的电网输出不稳定性。
据报道,施耐德电气电能质量专家、全球产品经理 Sreemant Roy 警告称,这类高度动态的负荷 " 会导致电网不稳定,若不加以纠正,可能引发停电或断电 "。他特别指出,数据中心可能引发次同步振荡,损坏电网其他节点的连接设备," 这已令全球电力公司深感忧虑 "。
监管层面,NERC 在过去两年内多次发出警告,将数据中心列为电网稳定性的最大风险之一。
据 NERC 去年 9 月的报告,在对美国逾 33 吉瓦在运数据中心的评估中,约四分之三的负荷模型 " 不足以反映数据中心的动态行为 "。今年早些时候,NERC 发出罕见的三级警报,要求大型数据中心于 8 月 3 日前提交应对方案。
面对上述挑战,产业链各环节正积极寻求解决方案。
英伟达表示,自 2024 年发布 Blackwell GPU 起,已加强与电力专家的合作。英伟达超大规模基础设施解决方案高级总监 Dion Harris 表示,公司正致力于在数据中心建设、设计、工程及电力输送各环节实现更平稳的部署。
在运营层面,部分数据中心用户已采用 " 侧边计算 " 技术——运行不属于训练流程的虚拟计算任务,以维持 GPU 稳定运行、平滑用电波动。但批评者指出,这一方法在电力需求本已高涨之际造成了额外的电力浪费。
在政策层面,美国能源部去年委托科罗拉多州丹佛附近的国家洛基山实验室(NLR)建立测试平台,专门研究如何将 AI 安全接入电网。
NLR 项目经理 Martha Symko-Davies 表示,该平台配备 GPU 和发电设备,供开发者测试其系统能否应对 AI 负荷的波动性,并将用于测试电池、软件及其他稳压设备。" 我们现在有机会把这件事做对," 她说。