AI專題

AI 推論成本為何長期主導總支出:從九成佔比到18個月降280倍的數據脈絡

E
EffectStory 編輯部編輯部
發布 · 更新
AWS 估計推論佔機器學習模型生命週期成本約九成,而訓練僅是一次性運算;高頻寬記憶體頻寬限制與 KV Cache 隨上下文線性成長是推論成本居高不下的技術根源,但史丹佛 AI Index 顯示同等級模型的推論定價已在約18個月內下降逾280倍。

訓練是一次性、推論是永遠:為什麼推論的成本在不斷累積?

OpenAI GPT-4 的訓練是單次巨量運算,推論則在模型部署後隨每次使用持續發生。Epoch AI 估計,GPT-4 的訓練運算量約為 2.1e25 FLOP,是史上首個達到此量級的模型CITE:E1。相對於這種一次性、可被精確估計的訓練成本,AWS 指出推論在整個機器學習生命週期中通常佔去大部分資源用量——只要模型持續提供服務,推論運算就會隨使用量同步發生,不會像訓練那樣在完成後歸零CITE:E2

推論佔 AI 成本的九成:AWS 數據揭露的長期成本結構

AWS 估計,使用已訓練模型進行預測的推論過程,約佔一個機器學習模型總成本的90%CITE:E3。這個比例與前述「推論等同ML生命週期中大部分資源用量」的說法相互印證CITE:E2,顯示訓練階段的一次性運算成本,長期而言在總支出結構中只佔相對次要的位置。

推論為什麼這麼昂貴:記憶體頻寬與 KV Cache 的技術根源

Dong等人在arXiv研究指出,大型語言模型推論解碼階段呈現明顯的記憶體頻寬受限特性,原因是受高頻寬記憶體(HBM)頻寬限制CITE:E4。Dell Technologies發布的另一篇arXiv研究進一步指出,KV cache 的記憶體佔用會隨上下文長度線性成長,對GPU記憶體容量、記憶體頻寬與推論吞吐量形成關鍵瓶頸,是推論成本(尤其是長上下文與長輸出情境)的主要驅動因素CITE:E6

硬體創新能改變遊戲規則嗎:推論專用 ASIC 的成本優勢

AWS表示,Inferentia2搭載的EC2 Inf2執行個體是部署生成式AI最具成本效益、最省電的選項CITE:E5。AWS並具體指出,Inf2執行個體的每瓦效能較同級EC2執行個體最高提升50%CITE:E5,顯示硬體層級的最佳化是壓低推論成本的可行槓桿之一。

推論 token 計價如何在 18 個月內暴跌 280 倍:從 20 美元到 0.07 美元

史丹佛HAI指出,同等級模型的token查詢成本在18個月內從20美元降至0.07美元CITE:E7。具體而言,達到GPT-3.5水準(MMLU 64.8分)的模型每百萬token查詢成本,已從2022年11月的20.00美元降至2024年10月的0.07美元CITE:E7,約18個月內下降逾280倍,是證據包中唯一能直接呈現推論成本隨時間變化幅度的量化數據CITE:E7

指標數值時間/來源
GPT-4訓練運算量約2.1e25 FLOP2025-06,Epoch AI估計CITE:E1
推論佔ML模型成本比例約90%2022-04-27,AWSCITE:E3
Inferentia2每瓦效能提升最高50%2023-04-13,AWSCITE:E5
GPT-3.5等級模型token查詢成本(2022年11月)每百萬token 20.00美元2022-11,史丹佛HAICITE:E7
GPT-3.5等級模型token查詢成本(2024年10月)每百萬token 0.07美元2024-10,史丹佛HAICITE:E7
上述期間降幅逾280倍(約18個月)2025,史丹佛HAICITE:E7

這代表什麼:從AWS的90%成本佔比與GPT-4約2.1e25 FLOP的一次性訓練運算量對照可見,訓練與推論屬於不同性質的成本——前者集中發生、可被精確估計;後者隨部署持續累積CITE:E1CITE:E3。技術層面,HBM頻寬限制與KV cache隨上下文長度線性成長的特性,說明了推論成本為何難以單純靠使用量下降而降低CITE:E4CITE:E6。與此同時,AWS Inferentia2每瓦效能較同級EC2執行個體最高提升50%,而史丹佛HAI記錄的同等級模型token查詢成本在18個月內下降逾280倍,兩項數據分別呈現硬體端與市場端的成本下行證據CITE:E5CITE:E7

📊 證據與數據

常見問題

訓練是一次性、推論是永遠:為什麼推論的成本在不斷累積?

OpenAI GPT-4 的訓練是單次巨量運算,推論則在模型部署後隨每次使用持續發生。Epoch AI 估計,GPT-4 的訓練運算量約為 2.1e25 FLOP,是史上首個達到此量級的模型CITE:E1。

推論為什麼這麼昂貴:記憶體頻寬與 KV Cache 的技術根源

Dong等人在arXiv研究指出,大型語言模型推論解碼階段呈現明顯的記憶體頻寬受限特性,原因是受高頻寬記憶體(HBM)頻寬限制CITE:E4。

硬體創新能改變遊戲規則嗎:推論專用 ASIC 的成本優勢

AWS表示,Inferentia2搭載的EC2 Inf2執行個體是部署生成式AI最具成本效益、最省電的選項CITE:E5。AWS並具體指出,Inf2執行個體的每瓦效能較同級EC2執行個體最高提升50%CITE:E5,顯示硬體層級的最佳化是壓低推論成本的可行槓桿之一。

推論 token 計價如何在 18 個月內暴跌 280 倍:從 20 美元到 0.07 美元

史丹佛HAI指出,同等級模型的token查詢成本在18個月內從20美元降至0.07美元CITE:E7。具體而言,達到GPT-3.5水準(MMLU 64.8分)的模型每百萬token查詢成本,已從2022年11月的20.00美元降至2024年10月的0.

📎 資料來源

  1. Epoch AI — Models over 1e25 FLOP
  2. AWS — ML Sustainability (Inference Cost)
  3. AWS — EC2 Inf2 / Inferentia2
  4. arXiv 2504.06319 — Memory-bound Inference
  5. arXiv 2603.20397 — KV Cache Scaling
  6. Stanford HAI — AI Index Report 2025

延伸數據

作者觀點EffectStory 編輯部

把90%的成本佔比、HBM頻寬與KV cache隨上下文線性成長的瓶頸,以及18個月內token價格下降逾280倍這三組事實放在一起看,推論成本的下降主要靠硬體效率提升與規模化降價達成,而不是使用量減少;真正卡住成本的仍是記憶體頻寬與長上下文情境。後續值得觀察的具體指標,是像Inferentia2這類推論專用ASIC的每瓦效能提升幅度(目前官方數字為最高50%),能否持續追上KV cache隨上下文長度線性成長所帶來的記憶體頻寬需求。

E
EffectStory 編輯部編輯部

相關文章

專題

太陽能+儲能:人工智慧(AI)資料中心現在最務實的電力解方

太陽能發電成本十年間下降近九成,已低於天然氣,搭配均價每度115美元的鋰電池儲能後可延伸供電至夜間;2024年全球新增553GW太陽能,亞利桑那案場更已實際為Meta資料中心供電,但24小時基載仍需天然氣或核能等可調度電源補足。

Nathan ·