AI 推理成本為何一年崩跌十倍?從 token 價格看應用經濟的轉折
GPT-3 級能力的推理成本三年間下降約 1,000 倍,OpenAI 自家 GPT-4 到 GPT-4o 再降 150 倍,DeepSeek-R1 更把價格壓至 OpenAI o1 的 3.6%。
NVIDIA H100功耗達700瓦、Blackwell B200液冷版達1,200瓦、AMD MI325X達1,000瓦CITE:E1。三款主流AI加速器的滿載功耗已來到700瓦至1,200瓦的區間,其中B200液冷版是目前功耗最高的機型CITE:E1。一顆高階AI GPU滿載時的耗電量,相當於數個家庭同時用電CITE:E1。
傳統(非AI)資料中心機櫃電力密度約5–10瓩,而NVIDIA GB200 NVL72整櫃設計值達約120瓩,實測部署更達130–132瓩CITE:E2。這使GB200 NVL72的機櫃密度來到傳統機櫃的十餘倍CITE:E2。這正是資料中心必須全面改採液冷散熱的原因CITE:E2。
產業PUE(電力使用效率,數值越接近1代表損耗越低)平均約1.54,Google表示其全機隊近12個月的PUE約僅1.09CITE:E3。從1.54降到1.09,意味著超大規模業者已把用於散熱、配電等非運算損耗壓縮到接近理論下限CITE:E3。在AI時代,能效管理本身已成為資料中心業者的競爭門檻CITE:E3。
xAI的Colossus叢集約有10萬顆H100 GPU,取電約250MWCITE:E4。大型AI資料中心的用電規模,已從過去的百MW等級邁向GW級CITE:E4。以單顆H100功耗700瓦推算,10萬顆GPU本身理論滿載耗電已逾70MW,加計冷卻、配電等系統損耗後,Colossus整體取電達約250MWCITE:E1CITE:E4。
雲端業者已將電力供給列為擴產的主要瓶頸之一CITE:E5。新資料中心的落腳點,越來越取決於當地電網能否提供穩定且充足的電力,而非僅是土地或人力成本CITE:E5。這使電力供給從單純的營運成本項目,轉為決定資料中心能否興建、何時興建的前置條件CITE:E5。
AI訓練與推論需要大量高功率GPU長時間近滿載運轉,是其耗電遠超傳統雲端伺服器的根本原因CITE:E6。高密度部署GPU也衍生出龐大的散熱(液冷)需求,使電力密度遠超一般伺服器CITE:E6。這項技術特性,正是前述GPU功耗攀升(H100 700瓦、B200 1,200瓦)、機櫃密度暴增(5–10瓩到120瓩)一路傳導到叢集總用電(250MW)的根本成因CITE:E1CITE:E2CITE:E4CITE:E6。
| 層級 | 傳統/產業水準 | AI時代水準 |
|---|---|---|
| 單顆GPU功耗 | – | H100 700瓦、B200(液冷)1,200瓦、MI325X 1,000瓦CITE:E1 |
| 機櫃電力密度 | 5–10瓩 | GB200 NVL72約120瓩(實測部署130–132瓩)CITE:E2 |
| PUE(電力使用效率) | 產業平均1.54 | Google近12個月約1.09CITE:E3 |
| AI叢集總用電 | – | xAI Colossus約250MW(約10萬顆H100)CITE:E4 |
從單顆GPU的700至1,200瓦,到機櫃的5–10瓩暴增至約120瓩,再到叢集層級的約250MW,數字沿著硬體、機櫃、叢集三層一路放大CITE:E1CITE:E2CITE:E4。即使Google已將PUE壓低到1.09、遠優於產業平均1.54,效率提升發生在資料中心整體損耗這一層,並未改變GPU長時間近滿載運轉、高密度部署衍生散熱需求這個耗電根本成因CITE:E3CITE:E6。這正是為何雲端業者會把電力供給列為擴產瓶頸——效率管理能壓低損耗比例,卻無法抵銷需求端規模持續放大的壓力CITE:E5。
NVIDIA H100功耗達700瓦、Blackwell B200液冷版達1,200瓦、AMD MI325X達1,000瓦CITE:E1。三款主流AI加速器的滿載功耗已來到700瓦至1,200瓦的區間,其中B200液冷版是目前功耗最高的機型CITE:E1。
傳統(非AI)資料中心機櫃電力密度約5–10瓩,而NVIDIA GB200 NVL72整櫃設計值達約120瓩,實測部署更達130–132瓩CITE:E2。這使GB200 NVL72的機櫃密度來到傳統機櫃的十餘倍CITE:E2。這正是資料中心必須全面改採液冷散熱的原因CITE:E2。
產業PUE(電力使用效率,數值越接近1代表損耗越低)平均約1.54,Google表示其全機隊近12個月的PUE約僅1.09CITE:E3。從1.54降到1.09,意味著超大規模業者已把用於散熱、配電等非運算損耗壓縮到接近理論下限CITE:E3。在AI時代,能效管理本身已成為資料中心業者的競爭門檻CITE:E3。
xAI的Colossus叢集約有10萬顆H100 GPU,取電約250MWCITE:E4。大型AI資料中心的用電規模,已從過去的百MW等級邁向GW級CITE:E4。
這篇的數字排出一條清楚的階梯:GPU從700瓦到1,200瓦、機櫃從5–10瓩到約120瓩、叢集到約250MW,每一層都是前一層的放大,而非獨立現象。值得注意的是,Google把PUE壓到1.09、遠低於產業平均1.54,證明資料中心整體效率仍有優化空間,但這動作發生在「損耗」這一層,對GPU長時間近滿載運轉的用電本身沒有幫助。接下來該盯的具體指標,是機櫃密度(如GB200 NVL72的120瓩)與叢集總用電(如Colossus的250MW)是否持續同步攀升——如果兩者同步往上,代表電力供給瓶頸會比效率改善的速度更快浮現。
GPT-3 級能力的推理成本三年間下降約 1,000 倍,OpenAI 自家 GPT-4 到 GPT-4o 再降 150 倍,DeepSeek-R1 更把價格壓至 OpenAI o1 的 3.6%。
DeepSeek-V3 以 MIT 授權釋出 6,710 億參數的開源模型,訓練成本估算 557.6 萬美元一度震動市場,NVIDIA 單日蒸發 5,930 億美元市值;但晶片端仍卡關,昇騰 910C 效能僅 H100 六成、產能受 HBM 限制實際出貨遠低於預期,美國出口管制同步收緊至 H200 逐案審查。
科技巨頭正以核電因應AI資料中心用電成長:微軟重啟三哩島機組於2028年上線,Google、Amazon押注SMR多訂於2030年代初商轉,但NuScale旗艦SMR計畫已於2023年因成本上漲與訂戶不足終止。