首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
游戏 morning

AI没被电饿死,先被电“气”死了

2026-08-09 1 阅读 约10分钟阅读 半呆君
分享:
字号:
文 | 半呆君 先把丑话放前面:AI大概率不是被电饿死的,是被电“气”死的。“饿”是电不够,全世界的电网都在排队解决;“气”是电不好,电压抖一抖、凹下去一截,训练就断了——这笔账,算力成本表里没有这一栏。这篇文章,就说清楚“气”从哪来、谁在填坑。 大家都在算AI吃多少电,没人算电干不干净 “AI要被电饿死了。”这句话我听了两年,从行业饭局听到券商研报。它没毛病——可我今天想写的,是没人算的那笔账。 “饿”到什么程度?IEA测算,2026年全球AI数据中心用电量将达945TWh(2026-08媒体引用)。美国弗吉尼亚州,新建数据中心排队等并网,一等就是3到5年(2026年行业调研)。国内智算规模冲到78万PFLOPS(华金证券,2026-01),电力变压器交付周期拉到12到18个月(华尔街见闻2026-05产业访谈)。变压器都造不过来,这还不是缺电? 是缺电。但缺电是“量”的问题。量的问题好办:花钱、排队、等政策,全球电网都在给AI加班。真正没人算的,是“质”——电干不干净。你插上电,电压从来不是一条直线,它一直在抖。抖得狠了,电压会突然凹下去一截,持续10毫秒到2秒,再自己弹回来——这就是电压暂降。你这边灯都没闪,机房里的算力设备已经错乱了。 跟停电比,电压波动是另一个世界。停电是分钟级以上,上了统计:供电可靠性指标 RS-1、系统平均停电持续时间指标 SAIDI 盯着,新闻天天播。电压暂降不构成停电,不进任何统计,UPS兜底一响就翻篇——没人向你道歉,也没人给你记账。亚洲电能质量联盟2015年对200个典型用户的监测显示:电压不稳占全部电能质量事件的89.2%,工业用户年均遭遇20.5次。一年20多次,每次都静悄悄。 所有人都在算AI吃多少电,没人算电干不干净。量的问题,全世界排队解决;质的问题,连算力成本表里都找不到这一栏。而这一栏,可能是先压垮算力的那根稻草。 0.01秒杀不死AI,“电脏”天天在杀 “断电0.01秒,烧掉几十万”——经济观察报2026年8月4日的热搜,干算力这行的都刷到过。评论区一片心梗表情:机房跳一下闸,一月利润没了。 但先把账算清楚。0.01秒,也就是10毫秒,通常根本到不了服务器。2026年的技术资料写得很明白:在线式双转换UPS切换0毫秒,供电不中断;就算UPS慢半拍,服务器电源还有“保持时间”兜底——Intel ATX12V标准要求≥16毫秒,企业级 CRPS(通用冗余电源)电源≥20毫秒。10毫秒的抖动,电源撑一下就过去了。“0.01秒烧几十万”,是把最坏情形当成了典型:没UPS、没checkpoint(检查点存档)、恢复还慢,全套buff叠满才有这个价。 真正的损失公式,跟时长没关系,只有两个变量:checkpoint间隔,乘以集群每小时成本。生产环境里checkpoint每15到60分钟做一次(MinIO工程指南是这么写的);按GMI Cloud 2026年租价,每卡每小时2到3.9美元,万卡H100集群每小时成本约15到28万人民币(按汇率约7.2折算)。所以万卡集群断电一次,上限场景——整小时白算、恢复又慢——也就15到28万;按同租价同汇率折算,1.6万卡集群停1小时,下限约23万、上限约45万。单次看肉疼,但不致命。 致命的是级联。checkpoint写到一半断电,文件损坏,回退好几个周期;浪涌还能带走硬件;再撞上合同的违约金条款。2025年6月有个32节点集群的真实案例:26小时算力损失约18万,2块GPU损坏约15万,项目延期违约金超150万——加起来超200万。单次断电的账,是级联帮忙放大算出来的。 反直觉的是,头部玩家早把这当常态了。Meta 2024年训练LLaMA-3的实录:1.6万张H100,54天里中断466次,其中419次非预期,平均每3小时一次,单次恢复目标控制在10分钟以内。人家不是不断电,是默认断电会发生,把恢复练成了肌肉记忆。 最讽刺的对比在隔壁:半导体晶圆厂怕晃电,有 SEMI F47(半导体设备电压暂降抗扰度)标准——设备必须扛住0.5个周期(约8到10毫秒)的电压暂降不跳机。数据中心呢?没有任何对等标准。晶圆怕晃电有标准,算力怕晃电没标准——0.01秒杀不死AI,但“电脏”天天在杀,只是没人算过这笔账。 电“气”死AI的,可能就是AI自己 “UPS早就是标配了。”你要是管过数据中心,一定听过这句话。这个反驳,我认。在线式双转换UPS切换0ms,市电侧普通的电压暂降,它确实扛得住。市电侧那种常见的几十毫秒暂降,对它来说基本是挠痒痒。这条反例成立,先认下。 但问题,恰恰出在UPS身上。 先说机柜里的瞬态。GPU集群的负载能在毫秒级从20%跃迁到90%(2026年产业技术资料),DC母线掉压发生在UPS输出之后——UPS物理上够不着。最先用脚投票的,是英伟达自己:GB300 NVL72电源架集成能量存储,每GPU 65焦耳、峰值电网需求降低约30%(NVIDIA官方博客,2025-07-28,官方说法是削峰降并网压力,未必直指暂降);再早的GB200已内置超级电容。无论出发点是削峰还是扛暂降,结果都指向一处——能量补在了 UPS 输出之后的机柜侧,UPS 的后段保护被绕开了。产业链用脚投票:UPS 在毫秒级脉冲面前不够用。 再看UPS自己。2016年,AWS悉尼,一次超长电压暂降直接打穿动态旋转式 UPS(DRUPS),可用区宕机。2025年3月,Google Cloud us-east5-c,市电失电后电压骤升持续近1分钟,UPS级联失效,宕机约6小时。“有UPS也宕机”,实锤。 最狠的在电网这一层。2024年7月10日,北弗吉尼亚:一条230kV线路的避雷器故障,砸出6次电压凹陷,全部落在 ANSI C84.1(美国供电电压容差标准) ±10% 正常带内——按书本,电网没违规。 但约60个数据中心的UPS,按各自固件规则集体切到电池和柴发,82秒内约1.5GW负载从PJM电网消失(另一口径为3.1GW),频率飙升,电网紧急切除约15亿瓦发电。最诡异的是,每一台UPS都在尽忠职守,可60台尽忠职守凑在一起,反而把电网逼到了悬崖边。2025年2月,约40家数据中心同步脱网,PJM频率冲到60.047Hz,NERC成立大型负荷工作组,FERC启动专项调查(南方能源观察,2026-03-24)。 所以,答案得反过来:UPS不是答案,UPS是问题的一部分。AI的毫秒级功率脉冲,在电“气”自己的电源之外,还电“气”了整个电网。 这还没完。GPU开关电源的谐波畸变率THD>5%(工程实测数据),大容量功率因数校正电容(PFC)与 UPS 电容级在特定频率谐振,变压器过热、继电保护误动作。国内行业统计显示,2025年约32%的数据中心非计划宕机与晃电相关。 受害者与施害者,原来是一体的:算力越大,脉冲越猛,电能质量问题越严重。这不是临时故障,是结构性矛盾。 再稳的电网,也保不住毫秒级的“气” 先泼盆冷水:中国电网,确实比美国稳。国家能源局2025年3月发布,2024年全国用户平均停电6.71小时/户、供电可靠率99.924%;美国平均停电11小时,创十年新高(EIA,2025年12月),中国不到人家六成。2025年上半年,供电
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱