AI 推理成本為何一年崩跌十倍?從 token 價格看應用經濟的轉折
GPT-3 級能力的推理成本三年間下降約 1,000 倍,OpenAI 自家 GPT-4 到 GPT-4o 再降 150 倍,DeepSeek-R1 更把價格壓至 OpenAI o1 的 3.6%。
DeepSeek 以混合專家(MoE)架構的 DeepSeek-V3,採 MIT 授權釋出前沿級開源權重模型CITE:E1。該模型總參數達 6,710 億,每個 token 僅啟用 370 億參數,並以 14.8 兆 tokens 訓練完成CITE:E1。論文自報的訓練成本約 557.6 萬美元,但這僅涵蓋『最終正式訓練那一次』、以 H800 每小時 2 美元計算,論文明文排除先前研究與架構、資料的消融實驗,並非總研發或硬體資本支出CITE:E2。外界『中國用不到 600 萬美元做出前沿模型』的說法,常見誤讀了這個口徑CITE:E2。
DeepSeek-R1 在論文中的推理性能與 OpenAI o1 相當,但仍為廠商自跑測試CITE:E3。2025 年 1 月發布的 R1,在 AIME 2024 測試中的分數為 79.8%,對比 o1 的 79.2%CITE:E3。此對標對象是 o1,而非最新前沿閉源模型;第三方指數顯示,中國模型是目前最強的『開源權重』模型,但仍略遜於頂尖閉源模型CITE:E3。
NVIDIA 在 2025 年 1 月 27 日單日市值蒸發約 5,930 億美元,為美股史上最大單日市值損失CITE:E4。當日股價下跌約 17%CITE:E4。市場一度擔心,低成本開源模型會削弱高階算力需求CITE:E4。
華為昇騰 910C 單晶片有效性能約為 NVIDIA H100 的六成,第三方分析估落後約一個世代CITE:E5。華為靠 CloudMatrix 384 等系統級堆疊在整機算力上追趕,代價是功耗約為 NVIDIA GB200 NVL72 的 4.1 倍CITE:E5。真正的硬約束在於高頻寬記憶體(HBM)而非邏輯產能:第三方估計昇騰 2025 年產能雖可達約 80 萬顆,但受 HBM 供給卡住,實際出貨僅約 20 萬至 30 萬顆CITE:E6。上游的中芯(SMIC)先進製程停在 7 奈米、以 DUV 多重曝光實現、未採用極紫外光微影(EUV)設備,良率仍低於產業常態水準CITE:E6。
美國商務部自 2025 年 4 月 9 日起,要求 H20 特供晶片出口須取得許可,形同禁售CITE:E7。2025 年 5 月 13 日,美方廢除舊有的『AI 擴散規則』,並警告使用華為昇騰恐涉違規CITE:E7。2026 年 1 月 13 日,美方改對 H200 等晶片採逐案審查CITE:E7。至於流傳的『需繳 15% 中國營收給美國政府』說法,並無 BIS 條文佐證,屬未證實說法CITE:E7。
| 項目 | 數據 | 時間/備註 |
|---|---|---|
| DeepSeek-V3 參數規模 | 總參數 6,710 億 / 啟用 370 億 / 14.8 兆 tokens | MIT 授權CITE:E1 |
| DeepSeek-V3 訓練成本 | 約 557.6 萬美元 | 僅最終訓練跑CITE:E2 |
| R1 vs o1(AIME 2024) | 79.8% vs 79.2% | 廠商自跑CITE:E3 |
| NVIDIA 單日市值蒸發 | 約 5,930 億美元(股價 -17%) | 2025-01-27CITE:E4 |
| 昇騰 910C 有效性能 | 約為 H100 六成 | 單晶片估算CITE:E5 |
| CloudMatrix 384 功耗 | 約為 GB200 NVL72 的 4.1 倍 | 系統級堆疊CITE:E5 |
| 昇騰 2025 產能估 / 實際出貨 | 約 80 萬顆 / 約 20–30 萬顆 | 受 HBM 供給限制CITE:E6 |
| H20 出口許可生效 | 2025 年 4 月 9 日 | 形同禁售CITE:E7 |
| AI 擴散規則廢除 | 2025 年 5 月 13 日 | 警告使用昇騰恐違規CITE:E7 |
| H200 逐案審查生效 | 2026 年 1 月 13 日 | 取代舊規則CITE:E7 |
這代表什麼
把五段證據放在一起看,一個張力浮現:DeepSeek-V3、R1 的開源與對標數字顯示中國在模型層已具備前沿級能力CITE:E1CITE:E3,並曾引發 NVIDIA 單日蒸發 5,930 億美元市值的市場反應CITE:E4;但同一時間,晶片層的昇騰 910C 仍只有 H100 約六成有效性能,且受 HBM 供給卡住,實際出貨遠低於產能估計CITE:E5CITE:E6,美國的出口管制也持續收緊,從 H20 許可到 H200 逐案審查CITE:E7。模型端的開源突破與晶片端的產能瓶頸,呈現出兩種不同速度的競賽軌跡。
DeepSeek 以混合專家(MoE)架構的 DeepSeek-V3,採 MIT 授權釋出前沿級開源權重模型CITE:E1。該模型總參數達 6,710 億,每個 token 僅啟用 370 億參數,並以 14.8 兆 tokens 訓練完成CITE:E1。論文自報的訓練成本約 557.
DeepSeek-R1 在論文中的推理性能與 OpenAI o1 相當,但仍為廠商自跑測試CITE:E3。2025 年 1 月發布的 R1,在 AIME 2024 測試中的分數為 79.8%,對比 o1 的 79.2%CITE:E3。
NVIDIA 在 2025 年 1 月 27 日單日市值蒸發約 5,930 億美元,為美股史上最大單日市值損失CITE:E4。當日股價下跌約 17%CITE:E4。市場一度擔心,低成本開源模型會削弱高階算力需求CITE:E4。
華為昇騰 910C 單晶片有效性能約為 NVIDIA H100 的六成,第三方分析估落後約一個世代CITE:E5。華為靠 CloudMatrix 384 等系統級堆疊在整機算力上追趕,代價是功耗約為 NVIDIA GB200 NVL72 的 4.1 倍CITE:E5。
模型層的開源打破了『必須用最先進晶片才能做出前沿模型』的假設——DeepSeek-V3 以 557.6 萬美元等級的單次訓練成本搭配 MIT 授權,證明架構與資料效率能部分替代算力堆疊。但晶片端的真正瓶頸不在邏輯製程,而在 HBM 供給:昇騰 2025 年產能估 80 萬顆、實際出貨僅 20 萬至 30 萬顆,顯示中國 AI 的擴張速度受硬體供應鏈而非模型能力所限。接下來值得觀察的具體指標,是 H200 逐案審查(2026 年 1 月 13 日生效)上路後,中國企業取得先進晶片的實際核准情況。
GPT-3 級能力的推理成本三年間下降約 1,000 倍,OpenAI 自家 GPT-4 到 GPT-4o 再降 150 倍,DeepSeek-R1 更把價格壓至 OpenAI o1 的 3.6%。
科技巨頭正以核電因應AI資料中心用電成長:微軟重啟三哩島機組於2028年上線,Google、Amazon押注SMR多訂於2030年代初商轉,但NuScale旗艦SMR計畫已於2023年因成本上漲與訂戶不足終止。
全球私募信貸資產管理規模2025年已逾2.5兆美元,較2009年成長約5倍,由Apollo、Blackstone、Ares、KKR、Blue Owl主導;銀行退場、報酬率上升與AI資料中心融資需求共同推動擴張,IMF並示警其不透明與槓桿層疊恐釀系統性風險。