AI專題

什麼是 MoE 混合專家模型?為何讓大型語言模型啟用參數少卻更快更省

N
Nathan科技編輯 · 技術負責人
發布 · 更新
MoE 架構把大型語言模型的『總參數』與『啟用參數』分開,例如 Qwen3 235B 模型每次推理僅啟用 22B 參數,使模型能同時保有大容量與低運算成本;2026 年主流開源模型已集體採用此設計。

MoE 架構的基本原理:為什麼總參數和啟用參數分離?

MoE(混合專家)模型由多個專家子網路組成,每次推理僅啟用其中一小部分專家CITE:E1。這種架構的關鍵在於「總參數」與「啟用參數」分離:模型整體容量龐大,但單次運算只動用一小部分權重CITE:E1。以 Qwen3 235B-A22B 為例,總參數為 235B,但每次推理僅啟用 22BCITE:E2;DeepSeek V4-Pro 總參數達 1.6T,每次推理僅啟用 49BCITE:E2。兩者呈現同一種設計:模型容量大,但單次運算量小CITE:E2

模型總參數啟用參數
Qwen3 235B-A22B235B22B
DeepSeek V4-Pro1.6T49B

MoE 如何同時實現推理加速和成本降低?

MoE 模型的推理速度取決於啟用參數規模,而非總參數規模CITE:E3。因此一個總參數 235B 的 MoE 模型,運算時可以跑得像 22B 的密集模型一樣快,同時保有大模型的知識容量CITE:E3。這是 MoE 架構「總參數決定能力上限、啟用參數決定運算成本」的核心邏輯,也是它同時壓低推理成本又維持模型能力的原因CITE:E3

本地部署時,MoE 的兩面刃是什麼?

MoE 架構對本地部署有利:記憶體需要裝下全部參數,但運算頻寬只需服務啟用參數CITE:E4。這代表配備大容量統一記憶體的裝置(例如 Apple Silicon Mac)可以裝得下大型 MoE 模型,運算時仍能維持速度CITE:E4。但這個優勢有代價:總參數規模若過大,即使量化壓縮也可能超出單機記憶體上限CITE:E5。例如 1T 級的 Kimi K2、DeepSeek V4-Pro,即使採用 4-bit 量化,參數量仍超過單機記憶體容量,本地端跑不動CITE:E5。這凸顯 MoE「省算力、不省記憶體」的特性CITE:E5

2026 年開源模型為何集體擁抱 MoE 架構?

2026 年主流開源模型多數採用 MoE 架構,包括 DeepSeek V4、Qwen3、Kimi K2、GLM 等CITE:E6。這反映業界正以 MoE 架構解決同一個矛盾:既要大模型的能力,又要控制推理成本CITE:E6

這代表什麼:總參數與啟用參數的分離,讓 Qwen3 235B-A22B(22B 啟用)與 DeepSeek V4-Pro(49B 啟用)能以啟用參數的運算量完成推理,而非總參數的運算量CITE:E2CITE:E3。但同一個設計換來的是記憶體端的硬限制——1T 級模型即使採 4-bit 量化仍裝不進單機記憶體CITE:E5。2026 年 DeepSeek V4、Qwen3、Kimi K2、GLM 等主流開源模型集體採用 MoE 架構CITE:E6,顯示『省算力、不省記憶體』的取捨,已是目前開源模型設計的共同答案。

📊 證據與數據

常見問題

MoE 架構的基本原理:為什麼總參數和啟用參數分離?

MoE(混合專家)模型由多個專家子網路組成,每次推理僅啟用其中一小部分專家CITE:E1。這種架構的關鍵在於「總參數」與「啟用參數」分離:模型整體容量龐大,但單次運算只動用一小部分權重CITE:E1。

MoE 如何同時實現推理加速和成本降低?

MoE 模型的推理速度取決於啟用參數規模,而非總參數規模CITE:E3。因此一個總參數 235B 的 MoE 模型,運算時可以跑得像 22B 的密集模型一樣快,同時保有大模型的知識容量CITE:E3。

本地部署時,MoE 的兩面刃是什麼?

MoE 架構對本地部署有利:記憶體需要裝下全部參數,但運算頻寬只需服務啟用參數CITE:E4。這代表配備大容量統一記憶體的裝置(例如 Apple Silicon Mac)可以裝得下大型 MoE 模型,運算時仍能維持速度CITE:E4。

2026 年開源模型為何集體擁抱 MoE 架構?

2026 年主流開源模型多數採用 MoE 架構,包括 DeepSeek V4、Qwen3、Kimi K2、GLM 等CITE:E6。這反映業界正以 MoE 架構解決同一個矛盾:既要大模型的能力,又要控制推理成本CITE:E6。

📎 資料來源

  1. effectstory.com
  2. effectstory.com

延伸數據

作者觀點Nathan

MoE 的核心意義,是把『模型容量』與『推理成本』拆成兩個可以分開優化的變數:Qwen3 235B-A22B 用 22B 啟用參數,換取接近其總參數規模的知識容量,DeepSeek V4-Pro 更把總參數推到 1.6T 而僅啟用 49B。但這筆交易的隱藏成本在記憶體端——1T 級的 Kimi K2、DeepSeek V4-Pro 即使 4-bit 量化仍超出單機容量,說明『省算力』與『省記憶體』並非同一件事。接下來值得觀察的指標,是後續模型會傾向縮小總參數以利本地部署,還是持續擴大規模、把記憶體門檻留給硬體端解決。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

SpaceX攜輝達,馬斯克:太空AI資料中心明年升空

SpaceX與輝達(NVIDIA)合作打造的首批AI衛星Starmind AI1,將於明年第4季發射、2028年大規模部署,較原計畫提前至少一年;SpaceX同步向美國聯邦通訊委員會申請部署最多100萬顆衛星的網絡,並規劃明年底AI算力達近10 GW。

林紀旭 James Lin ·