AI News HubLIVE
站内改写5 分钟阅读

AI数据中心电力限制是2026年的真正瓶颈

文章指出,到2026年,AI基础设施的主要限制将从GPU供应转向电网容量。预计到2027年,40%的AI数据中心将受到电力限制,新电网连接的审批时间长达24-36个月。文章详细分析了电力需求、推理驱动电力曲线,并提出了效率提升、调度和地理分布等策略,同时推广Spheron的分布式GPU网络作为解决方案。

来源Hacker News AI作者: DaWe01

2024年,AI基础设施的稀缺资源是H100供应。到2026年,这一瓶颈转向了为这些GPU供电的电网连接。Gartner预测,到2027年,40%的AI数据中心将受到电力限制,而美国和欧洲主要市场的新电网容量审批时间现已长达24-36个月。硬件问题已开始缓解,但电力问题尚未解决。

从GPU短缺到电力短缺的转变

在2023年和2024年的大部分时间里,讨论焦点是台积电的CoWoS封装产能和SK海力士的HBM供应。漫长的采购队列、芯片短缺和有限的H100可用性意味着团队受限于硬件获取,而非设备接入地点。然而,过去18个月中,GPU可用性显著改善,新云提供商和经销商现在提供的H100、H200和Blackwell容量在两年前是不可能获得的。但电网未能跟上步伐。

数据中心电力容量现已成为新AI基础设施部署的更紧迫约束。国际能源署(IEA)2025年《能源与AI》报告预测,到2030年,全球数据中心电力消耗可能翻倍,其中AI工作负载将占增量需求的大部分。包括北弗吉尼亚、硅谷和北欧在内的主要市场,新设施的电力审批时间已延长至24-36个月,无论硬件可用性如何。

这是一个不同于硬件稀缺的问题。无法通过在同一地点增加资本支出来解决电网审批积压。队列就是队列。

数字:AI数据中心电力需求为何加速增长

AI基础设施的电力需求规模是使约束如此严峻的原因。一个8x H100 SXM5节点在推理负载下约消耗10.1千瓦:每个GPU 700瓦,加上双CPU、NVLink交换机、512 GB RAM和负载下的电源单元等服务器开销。GPU约占节点总功耗的56%。扩展到1000个GPU(125个节点),包括典型数据中心冷却开销(PUE约1.4),连续功耗达1.76兆瓦。

下表显示了GPU数量与功耗及电网基础设施要求的映射关系:

GPU数量 | 连续功耗 | 所需电网基础设施 100 GPU | ~176 kW | 标准商业服务 500 GPU | ~880 kW | 专用变压器,需协调公用事业 1,000 GPU | ~1.76 MW | 专用变电站容量 5,000 GPU | ~8.8 MW | 中型公用变电站 10,000 GPU | ~17.6 MW | 专用公用事业互联,审批2年以上 50,000 GPU | ~88 MW | 大型公用事业规划,审批36个月以上

数据基于700W H100 TDP × 1.8服务器开销因子 × ~1.4 PUE。实际功耗因工作负载而异。

下一代站点正计划为超大规模计算园区提供100兆瓦至750兆瓦以上的电力。在此规模下,单个数据中心直接与市政电力基础设施竞争。审批周期类似于工业设施而非办公楼,这并不令人意外。

Gartner对2027年40%的预测是一个滞后指标。今天规划新数据中心容量的团队已经遇到这一约束,而非预测它。

为何推理驱动电力曲线

训练是一个有界的计算任务。你在定义数量的步骤上运行一个训练周期,完成后集群闲置。电力成本是一个有明确结束日期的项目支出。

推理则不同。每个部署的模型、每个API调用、每个用户请求持续消耗电力,全天候,只要模型在生产中。一个服务10,000日活跃用户的模型每天产生数百万次推理调用,且没有自然终点。

容量规划的含义直接:你不能仅围绕训练峰值来规划电力合同。一旦有部署产品,推理稳态负载占主导地位。行业分析预测,到2030年,推理将占AI能源消耗的约75%。

这就是为何每瓦特令牌数框架成为正确的度量单位,而非每美元FLOPS或GPU利用率。收入 = 每瓦特令牌数 × 可用吉瓦。如果吉瓦受电网限制,则每瓦特提取更多令牌是您可用的主要效率杠杆。

当无法获得电力时的容量规划

三种具体策略可在无需等待24-36个月的情况下解决约束。

效率优先:更多令牌每瓦特

FP8量化减少了激活内存压力和KV缓存大小,从而在相同功耗下实现更大的有效批大小。在H100硬件上使用vLLM,FP8通常比BF16在相同批大小下每秒多产生30-40%的令牌。这相当于在相同硬件上每次令牌电力成本降低23-29%。

连续批处理是大多数推理部署中影响最大的单一更改。以20%利用率一次处理单个请求的GPU,与以80%利用率进行连续批处理的相同GPU相比,功耗几乎相同。80%利用率带批处理的每瓦特令牌数大约高出5-10倍,而非4倍,因为TDP主要是固定开销。

KV缓存管理减少了活跃GPU内存压力,允许在不扩展集群的情况下每个GPU服务更多并发用户。

需追踪的指标:每秒令牌数除以GPU TDP(瓦特)。任何提高此比率的更改都能在不增加基础设施的情况下提高电力效率。

调度:按一天中的时间转移负载

批量推理作业、嵌入生成和非交互式工作负载可在电网非高峰时段运行。在许多市场中,夜间电价下降30-50%。安排在夜间的训练作业可降低能源成本并平抑峰值需求,这对具有需求计费账单的本地设施可能很重要。

对于交互式推理,在低流量时段减少活跃副本可降低连续功耗。针对GPU利用率超过60%(而非保留余量的30-40%)的自动缩放可从现有硬件中提取更多每瓦特令牌。

地理分布:跨电网分散负载

不要建设一个1,000 GPU、1.76兆瓦的站点,而是在不同地区、独立电网连接上运营十个100 GPU池。每个池消耗176千瓦,远低于需要公用事业规模基础设施升级的阈值。池间故障转移增加了可用性;无单一电网依赖。

这是对电力约束的结构性答案。它不需要单个大型设施审批。它需要访问跨多个电网已存在的容量。

地理和分布式GPU容量作为电力变通方案

24-36个月的电网审批是单一站点的问题。分布式容量完全绕过它。

Spheron聚合了来自全球数据中心合作伙伴的GPU容量,跨多个独立电网连接。按需访问意味着您可以在今天有电力余量的地区启动容量,无需等待自有设施的电网升级审批。对于一个需要500个GPU进行推理但无法扩展本地电力的团队,从分布式池租用相当于访问电网其他地方已存在的电力容量。

按分钟计费消除了搁浅容量。您在非高峰时段无需为闲置GPU功耗付费。财务运营影响直接:分布式云将电力成本从固定基础设施沉没成本转变为随实际使用变化的可变运营成本。

每瓦特令牌数指标直接适用于此模型中的GPU选择。下表使用Spheron GPU市场的实时按需定价(2026年6月24日):

GPU | 按需$/小时 | TDP | 令牌/秒(70B,FP8) | 估计令牌/瓦特 A100 SXM4 | $1.69 | 400W | ~500 | ~1.25 L40S on Spheron | $1.81 | 350W | n/a(48 GB VRAM) | n/a H100 SXM5 on Spheron | $4.06 | 700W | ~2,000 | ~2.86 H200 on Spheron | $5.82 | 700W | ~2,900 | ~4.14 B200 SXM6 | $9.36 | 1,000W | ~5,000 | ~5.0

定价根据GPU可用性波动。以上价格为2026年6月24日,可能已变化。查看当前GPU定价以获取最新费率。

H200和B200在每瓦特令牌数上领先,尽管绝对成本更高。对于连续功耗是约束的推理工作负载,H200以$5.82/小时的价格比TDP相同的H100($4.06/小时)每瓦特多产生45%的令牌。您从相同功耗预算中获得更高吞吐量。B200在Blackwell硬件上通过FP4支持进一步提升。

对于评估分布式云作为电力绕行方案的团队,问题不仅在于哪个GPU每小时最便宜,还在于哪个GPU在可用电力预算内提供最多令牌,因为这是约束条件。

有关设置和配置详情,请参阅Spheron文档。

电力感知的AI容量规划:操作员检查清单

  1. 审计当前GPU利用率和功耗。使用GPU TDP × 服务器开销(1.8)× PUE(1.3-1.45)计算连续功耗。在定价额外硬件前了解本地电力上限。
  2. 建模12个月的推理增长轨迹。将请求量增长映射到GPU小时数,然后到功耗。确定何时电力包络成为约束而非GPU数量。
  3. 在承诺本地扩展前检查当地电网余量。在硬件采购对话前进行设施或公用事业对话。2年的审批时间表使基于“我们会在需要时增加容量”的路线图无效。
  4. 在添加硬件前应用效率技术。FP8量化和连续批处理可在不增加GPU数量的情况下将每瓦特令牌数提高30-50%。在扩大电力足迹前修复此问题。
  5. 使用时移调度平抑负载峰值。批处理和非交互式工作负载可移至非高峰时段,降低峰值需求费用并改善电网合同效率。
  6. 对于新容量,在等待24-36个月电网审批前评估分布式云。分布式云在已有电力余量的地区提供容量。按分钟计费意味着无搁浅成本。
  7. 将每瓦特令牌数作为主要效率KPI。仅GPU利用率不能反映您如何有效使用电力预算。每瓦特令牌数可以。
  8. 对于多区域云部署,根据可用电力容量而非仅硬件规格选择提供商。一个跨多个独立电网聚合GPU库存的提供商在结构上比运营单个大型设施的提供商更能抵御本地电力约束。

电力约束不会很快消失

电力可用性已成为AI基础设施的约束,并且它不像GPU供应那样对资本支出做出响应。HBM晶圆厂扩建和CoWoS产能增加可在18-24个月内填补硬件瓶颈。公用事业规模的电网扩建与工业基础设施(而非半导体制造)时间表相同。

即时变通方案是分布:访问跨多个电网已存在的GPU容量,而非等待单一站点审批。长期倍增器是效率:每瓦特令牌数的每次改进都能在不需新基础设施的情况下扩展现有电力包络。

当本地电力约束限制了本地部署时,Spheron的分布式GPU网络可在多个地区和电网中按需提供容量,无需24-36个月审批周期。