AI專題

AI電力危機:從GPU到電網的功耗階梯

林紀旭 James Lin總編輯
發布 · 更新
NVIDIA H100、B200等AI加速器單顆功耗已達700至1,200瓦,機櫃電力密度因此從傳統5–10瓩暴增至GB200 NVL72約120瓩,xAI Colossus叢集用電已達約250MW,電力供給正成為資料中心擴產的主要瓶頸。

現代 AI 加速器的功耗已躍升到何種程度?

NVIDIA H100功耗達700瓦、Blackwell B200液冷版達1,200瓦、AMD MI325X達1,000瓦CITE:E1。三款主流AI加速器的滿載功耗已來到700瓦至1,200瓦的區間,其中B200液冷版是目前功耗最高的機型CITE:E1。一顆高階AI GPU滿載時的耗電量,相當於數個家庭同時用電CITE:E1

AI資料中心機櫃的電力密度如何激增至難以承受的水準?

傳統(非AI)資料中心機櫃電力密度約5–10瓩,而NVIDIA GB200 NVL72整櫃設計值達約120瓩,實測部署更達130–132瓩CITE:E2。這使GB200 NVL72的機櫃密度來到傳統機櫃的十餘倍CITE:E2。這正是資料中心必須全面改採液冷散熱的原因CITE:E2

超大規模資料中心如何透過PUE管理壓低能效損耗?

產業PUE(電力使用效率,數值越接近1代表損耗越低)平均約1.54,Google表示其全機隊近12個月的PUE約僅1.09CITE:E3。從1.54降到1.09,意味著超大規模業者已把用於散熱、配電等非運算損耗壓縮到接近理論下限CITE:E3。在AI時代,能效管理本身已成為資料中心業者的競爭門檻CITE:E3

現今AI叢集的總用電已達電廠級規模,具體數字為何?

xAI的Colossus叢集約有10萬顆H100 GPU,取電約250MWCITE:E4。大型AI資料中心的用電規模,已從過去的百MW等級邁向GW級CITE:E4。以單顆H100功耗700瓦推算,10萬顆GPU本身理論滿載耗電已逾70MW,加計冷卻、配電等系統損耗後,Colossus整體取電達約250MWCITE:E1CITE:E4

集中大功率負載對區域電網與資料中心選址帶來什麼瓶頸?

雲端業者已將電力供給列為擴產的主要瓶頸之一CITE:E5。新資料中心的落腳點,越來越取決於當地電網能否提供穩定且充足的電力,而非僅是土地或人力成本CITE:E5。這使電力供給從單純的營運成本項目,轉為決定資料中心能否興建、何時興建的前置條件CITE:E5

AI工作負載為何比傳統雲端基礎設施耗電得多?

AI訓練與推論需要大量高功率GPU長時間近滿載運轉,是其耗電遠超傳統雲端伺服器的根本原因CITE:E6。高密度部署GPU也衍生出龐大的散熱(液冷)需求,使電力密度遠超一般伺服器CITE:E6。這項技術特性,正是前述GPU功耗攀升(H100 700瓦、B200 1,200瓦)、機櫃密度暴增(5–10瓩到120瓩)一路傳導到叢集總用電(250MW)的根本成因CITE:E1CITE:E2CITE:E4CITE:E6

功耗階梯總覽

層級傳統/產業水準AI時代水準
單顆GPU功耗H100 700瓦、B200(液冷)1,200瓦、MI325X 1,000瓦CITE:E1
機櫃電力密度5–10瓩GB200 NVL72約120瓩(實測部署130–132瓩)CITE:E2
PUE(電力使用效率)產業平均1.54Google近12個月約1.09CITE:E3
AI叢集總用電xAI Colossus約250MW(約10萬顆H100)CITE:E4

這代表什麼

從單顆GPU的700至1,200瓦,到機櫃的5–10瓩暴增至約120瓩,再到叢集層級的約250MW,數字沿著硬體、機櫃、叢集三層一路放大CITE:E1CITE:E2CITE:E4。即使Google已將PUE壓低到1.09、遠優於產業平均1.54,效率提升發生在資料中心整體損耗這一層,並未改變GPU長時間近滿載運轉、高密度部署衍生散熱需求這個耗電根本成因CITE:E3CITE:E6。這正是為何雲端業者會把電力供給列為擴產瓶頸——效率管理能壓低損耗比例,卻無法抵銷需求端規模持續放大的壓力CITE:E5

📊 證據與數據

常見問題

現代 AI 加速器的功耗已躍升到何種程度?

NVIDIA H100功耗達700瓦、Blackwell B200液冷版達1,200瓦、AMD MI325X達1,000瓦CITE:E1。三款主流AI加速器的滿載功耗已來到700瓦至1,200瓦的區間,其中B200液冷版是目前功耗最高的機型CITE:E1。

AI資料中心機櫃的電力密度如何激增至難以承受的水準?

傳統(非AI)資料中心機櫃電力密度約5–10瓩,而NVIDIA GB200 NVL72整櫃設計值達約120瓩,實測部署更達130–132瓩CITE:E2。這使GB200 NVL72的機櫃密度來到傳統機櫃的十餘倍CITE:E2。這正是資料中心必須全面改採液冷散熱的原因CITE:E2。

超大規模資料中心如何透過PUE管理壓低能效損耗?

產業PUE(電力使用效率,數值越接近1代表損耗越低)平均約1.54,Google表示其全機隊近12個月的PUE約僅1.09CITE:E3。從1.54降到1.09,意味著超大規模業者已把用於散熱、配電等非運算損耗壓縮到接近理論下限CITE:E3。在AI時代,能效管理本身已成為資料中心業者的競爭門檻CITE:E3。

現今AI叢集的總用電已達電廠級規模,具體數字為何?

xAI的Colossus叢集約有10萬顆H100 GPU,取電約250MWCITE:E4。大型AI資料中心的用電規模,已從過去的百MW等級邁向GW級CITE:E4。

📎 資料來源

  1. effectstory.com
  2. sunbirddcim.com
  3. datacenters.google
  4. en.wikipedia.org

延伸數據

作者觀點林紀旭 James Lin

這篇的數字排出一條清楚的階梯:GPU從700瓦到1,200瓦、機櫃從5–10瓩到約120瓩、叢集到約250MW,每一層都是前一層的放大,而非獨立現象。值得注意的是,Google把PUE壓到1.09、遠低於產業平均1.54,證明資料中心整體效率仍有優化空間,但這動作發生在「損耗」這一層,對GPU長時間近滿載運轉的用電本身沒有幫助。接下來該盯的具體指標,是機櫃密度(如GB200 NVL72的120瓩)與叢集總用電(如Colossus的250MW)是否持續同步攀升——如果兩者同步往上,代表電力供給瓶頸會比效率改善的速度更快浮現。

林紀旭 James Lin總編輯

相關文章

專題

中國 AI 突圍全貌:DeepSeek 模型端衝上前沿,晶片端仍卡一個世代

DeepSeek-V3 以 MIT 授權釋出 6,710 億參數的開源模型,訓練成本估算 557.6 萬美元一度震動市場,NVIDIA 單日蒸發 5,930 億美元市值;但晶片端仍卡關,昇騰 910C 效能僅 H100 六成、產能受 HBM 限制實際出貨遠低於預期,美國出口管制同步收緊至 H200 逐案審查。

Nathan ·