太陽能+儲能:人工智慧(AI)資料中心現在最務實的電力解方
太陽能發電成本十年間下降近九成,已低於天然氣,搭配均價每度115美元的鋰電池儲能後可延伸供電至夜間;2024年全球新增553GW太陽能,亞利桑那案場更已實際為Meta資料中心供電,但24小時基載仍需天然氣或核能等可調度電源補足。
OpenAI GPT-4 的訓練是單次巨量運算,推論則在模型部署後隨每次使用持續發生。Epoch AI 估計,GPT-4 的訓練運算量約為 2.1e25 FLOP,是史上首個達到此量級的模型CITE:E1。相對於這種一次性、可被精確估計的訓練成本,AWS 指出推論在整個機器學習生命週期中通常佔去大部分資源用量——只要模型持續提供服務,推論運算就會隨使用量同步發生,不會像訓練那樣在完成後歸零CITE:E2。
AWS 估計,使用已訓練模型進行預測的推論過程,約佔一個機器學習模型總成本的90%CITE:E3。這個比例與前述「推論等同ML生命週期中大部分資源用量」的說法相互印證CITE:E2,顯示訓練階段的一次性運算成本,長期而言在總支出結構中只佔相對次要的位置。
Dong等人在arXiv研究指出,大型語言模型推論解碼階段呈現明顯的記憶體頻寬受限特性,原因是受高頻寬記憶體(HBM)頻寬限制CITE:E4。Dell Technologies發布的另一篇arXiv研究進一步指出,KV cache 的記憶體佔用會隨上下文長度線性成長,對GPU記憶體容量、記憶體頻寬與推論吞吐量形成關鍵瓶頸,是推論成本(尤其是長上下文與長輸出情境)的主要驅動因素CITE:E6。
AWS表示,Inferentia2搭載的EC2 Inf2執行個體是部署生成式AI最具成本效益、最省電的選項CITE:E5。AWS並具體指出,Inf2執行個體的每瓦效能較同級EC2執行個體最高提升50%CITE:E5,顯示硬體層級的最佳化是壓低推論成本的可行槓桿之一。
史丹佛HAI指出,同等級模型的token查詢成本在18個月內從20美元降至0.07美元CITE:E7。具體而言,達到GPT-3.5水準(MMLU 64.8分)的模型每百萬token查詢成本,已從2022年11月的20.00美元降至2024年10月的0.07美元CITE:E7,約18個月內下降逾280倍,是證據包中唯一能直接呈現推論成本隨時間變化幅度的量化數據CITE:E7。
| 指標 | 數值 | 時間/來源 |
|---|---|---|
| GPT-4訓練運算量 | 約2.1e25 FLOP | 2025-06,Epoch AI估計CITE:E1 |
| 推論佔ML模型成本比例 | 約90% | 2022-04-27,AWSCITE:E3 |
| Inferentia2每瓦效能提升 | 最高50% | 2023-04-13,AWSCITE:E5 |
| GPT-3.5等級模型token查詢成本(2022年11月) | 每百萬token 20.00美元 | 2022-11,史丹佛HAICITE:E7 |
| GPT-3.5等級模型token查詢成本(2024年10月) | 每百萬token 0.07美元 | 2024-10,史丹佛HAICITE:E7 |
| 上述期間降幅 | 逾280倍(約18個月) | 2025,史丹佛HAICITE:E7 |
這代表什麼:從AWS的90%成本佔比與GPT-4約2.1e25 FLOP的一次性訓練運算量對照可見,訓練與推論屬於不同性質的成本——前者集中發生、可被精確估計;後者隨部署持續累積CITE:E1CITE:E3。技術層面,HBM頻寬限制與KV cache隨上下文長度線性成長的特性,說明了推論成本為何難以單純靠使用量下降而降低CITE:E4CITE:E6。與此同時,AWS Inferentia2每瓦效能較同級EC2執行個體最高提升50%,而史丹佛HAI記錄的同等級模型token查詢成本在18個月內下降逾280倍,兩項數據分別呈現硬體端與市場端的成本下行證據CITE:E5CITE:E7。
OpenAI GPT-4 的訓練是單次巨量運算,推論則在模型部署後隨每次使用持續發生。Epoch AI 估計,GPT-4 的訓練運算量約為 2.1e25 FLOP,是史上首個達到此量級的模型CITE:E1。
Dong等人在arXiv研究指出,大型語言模型推論解碼階段呈現明顯的記憶體頻寬受限特性,原因是受高頻寬記憶體(HBM)頻寬限制CITE:E4。
AWS表示,Inferentia2搭載的EC2 Inf2執行個體是部署生成式AI最具成本效益、最省電的選項CITE:E5。AWS並具體指出,Inf2執行個體的每瓦效能較同級EC2執行個體最高提升50%CITE:E5,顯示硬體層級的最佳化是壓低推論成本的可行槓桿之一。
史丹佛HAI指出,同等級模型的token查詢成本在18個月內從20美元降至0.07美元CITE:E7。具體而言,達到GPT-3.5水準(MMLU 64.8分)的模型每百萬token查詢成本,已從2022年11月的20.00美元降至2024年10月的0.
把90%的成本佔比、HBM頻寬與KV cache隨上下文線性成長的瓶頸,以及18個月內token價格下降逾280倍這三組事實放在一起看,推論成本的下降主要靠硬體效率提升與規模化降價達成,而不是使用量減少;真正卡住成本的仍是記憶體頻寬與長上下文情境。後續值得觀察的具體指標,是像Inferentia2這類推論專用ASIC的每瓦效能提升幅度(目前官方數字為最高50%),能否持續追上KV cache隨上下文長度線性成長所帶來的記憶體頻寬需求。
太陽能發電成本十年間下降近九成,已低於天然氣,搭配均價每度115美元的鋰電池儲能後可延伸供電至夜間;2024年全球新增553GW太陽能,亞利桑那案場更已實際為Meta資料中心供電,但24小時基載仍需天然氣或核能等可調度電源補足。
歐盟GPAI執法權2026年8月2日啟動,高風險義務卻延至2027—2028年;加州SB53、AB2013已於2026年1月1日生效規範前沿AI開發者,白宮同時令司法部成立工作組挑戰州法,構成監管執法元年的角力格局。
全球載客eVTOL賽局進度分歧:中國億航已集齊完整認證,2025年交付221架並首度獲利;美國Joby與Archer仍卡在認證與規劃階段;德國Lilium與Volocopter相繼破產,Volocopter已由中國萬豐收購續留歐洲。