AI專題

MoE 混合專家架構如何在不增加運算量下擴大模型參數規模?

N
Nathan科技編輯 · 技術負責人
發布 · 更新
混合專家(MoE)架構透過稀疏啟動機制,讓模型在推論時只動用部分參數,即可將總參數規模擴大而運算成本幾乎不變。

MoE 為什麼能在不增加運算量的情況下擴大參數規模?

MoE架構藉由強制稀疏性,讓模型不必為每個輸入token啟動整個神經網路,因而能在運算成本幾乎不變的情況下擴大模型容量CITE:E1。IBM說明,這種「不啟動整個神經網路」的設計,是MoE方法區別於傳統模型的核心優勢CITE:E1

稀疏啟動與路由機制如何運作?

在Mixtral架構中,路由網路會從多組專家中選出兩組來處理每一個token,並將其輸出相加結合CITE:E4。Hugging Face進一步說明,MoE模型雖然可能擁有大量參數,但推論時只會用到其中一部分CITE:E5。這代表模型的「總參數」與「實際運算所需的參數」是兩個可以被拆開的變數。

Mixtral 8x7B 的多專家架構如何設計?

Mistral AI的Mixtral 8x7B語言模型,每一層由8個前饋區塊(即專家)組成,每個專家各擁有70億個參數CITE:E2。這8個專家並非同時全部運算,而是依前述路由機制,每次由路由網路挑選其中2個專家處理輸入的tokenCITE:E4

模型總參數與實際啟動參數之間有何落差?

Mixtral的每個輸入token雖可存取467億個參數,但實際處理單一範例時僅使用129億個啟動參數CITE:E3。這項數字呼應了Hugging Face的說明:MoE模型的參數規模雖大,推論階段實際啟用的僅是其中一部分CITE:E5

項目數值證據來源
Mixtral 8x7B 專家數量8 個CITE:E2
每個專家的參數量70 億CITE:E2
路由網路每次選取的專家數2 個CITE:E4
Mixtral 每 token 可存取總參數467 億CITE:E3
Mixtral 實際啟動參數129 億CITE:E3
Switch Transformers 相較 T5-XXL 的預訓練加速倍數4 倍CITE:E6

MoE 相比傳統模型在推訓性能上有何實證改善?

Hugging Face揭露,Switch Transformers相較於T5-XXL在預訓練速度上達成4倍加速CITE:E6。這項數據與Mixtral的啟動參數落差(129億對467億)共同構成MoE架構在訓練與推論兩端的效率證據。

這代表什麼

綜合以上證據,MoE架構的稀疏啟動機制讓Mixtral在467億總參數規模下,單一輸入只需動用129億個啟動參數,並由路由網路從8個專家中選出2個實際運算;而在訓練端,Switch Transformers相較T5-XXL達成4倍的預訓練加速。這些數字共同指向同一件事:MoE把「參數規模」與「運算成本」拆成兩個可分別調整的變數,而非兩者必然同步增長。

📊 證據與數據

常見問題

MoE 為什麼能在不增加運算量的情況下擴大參數規模?

MoE架構藉由強制稀疏性,讓模型不必為每個輸入token啟動整個神經網路,因而能在運算成本幾乎不變的情況下擴大模型容量CITE:E1。IBM說明,這種「不啟動整個神經網路」的設計,是MoE方法區別於傳統模型的核心優勢CITE:E1。

稀疏啟動與路由機制如何運作?

在Mixtral架構中,路由網路會從多組專家中選出兩組來處理每一個token,並將其輸出相加結合CITE:E4。Hugging Face進一步說明,MoE模型雖然可能擁有大量參數,但推論時只會用到其中一部分CITE:E5。這代表模型的「總參數」與「實際運算所需的參數」是兩個可以被拆開的變數。

Mixtral 8x7B 的多專家架構如何設計?

Mistral AI的Mixtral 8x7B語言模型,每一層由8個前饋區塊(即專家)組成,每個專家各擁有70億個參數CITE:E2。這8個專家並非同時全部運算,而是依前述路由機制,每次由路由網路挑選其中2個專家處理輸入的tokenCITE:E4。

模型總參數與實際啟動參數之間有何落差?

Mixtral的每個輸入token雖可存取467億個參數,但實際處理單一範例時僅使用129億個啟動參數CITE:E3。這項數字呼應了Hugging Face的說明:MoE模型的參數規模雖大,推論階段實際啟用的僅是其中一部分CITE:E5。

📎 資料來源

  1. ibm.com
  2. mistral.ai
  3. huggingface.co
作者觀點Nathan

MoE的價值不在參數總量本身,而在於路由機制把「容量」與「運算成本」這兩個原本綁定的變數拆開。Mixtral以467億總參數換取129億啟動參數的設計,加上Switch Transformers相較T5-XXL達成的4倍預訓練加速,都指向同一個工程判斷:稀疏啟動是目前擴大模型規模、同時控制成本的直接路徑。後續值得持續追蹤的指標,是啟動參數與總參數的比例(如Mixtral的129億/467億)在模型規模進一步擴大時是否維持穩定,這將決定稀疏化帶來的效率能否延續。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·