中華車旗下綠捷推四足機器人GT5X、GT3X 拚2027年台灣自製率100%
中華車旗下綠捷發表四足機器人GT5X與GT3X,訂定2027年在地自製率100%目標;團隊由原中華汽車人馬轉任、逾15年車用技術經驗,並分別與恩嘉科技、輝達NVIDIA、台塑新智能合作AI運算與電池系統。
MoE架構藉由強制稀疏性,讓模型不必為每個輸入token啟動整個神經網路,因而能在運算成本幾乎不變的情況下擴大模型容量CITE:E1。IBM說明,這種「不啟動整個神經網路」的設計,是MoE方法區別於傳統模型的核心優勢CITE:E1。
在Mixtral架構中,路由網路會從多組專家中選出兩組來處理每一個token,並將其輸出相加結合CITE:E4。Hugging Face進一步說明,MoE模型雖然可能擁有大量參數,但推論時只會用到其中一部分CITE:E5。這代表模型的「總參數」與「實際運算所需的參數」是兩個可以被拆開的變數。
Mistral AI的Mixtral 8x7B語言模型,每一層由8個前饋區塊(即專家)組成,每個專家各擁有70億個參數CITE:E2。這8個專家並非同時全部運算,而是依前述路由機制,每次由路由網路挑選其中2個專家處理輸入的tokenCITE:E4。
Mixtral的每個輸入token雖可存取467億個參數,但實際處理單一範例時僅使用129億個啟動參數CITE:E3。這項數字呼應了Hugging Face的說明:MoE模型的參數規模雖大,推論階段實際啟用的僅是其中一部分CITE:E5。
| 項目 | 數值 | 證據來源 |
|---|---|---|
| Mixtral 8x7B 專家數量 | 8 個 | CITE:E2 |
| 每個專家的參數量 | 70 億 | CITE:E2 |
| 路由網路每次選取的專家數 | 2 個 | CITE:E4 |
| Mixtral 每 token 可存取總參數 | 467 億 | CITE:E3 |
| Mixtral 實際啟動參數 | 129 億 | CITE:E3 |
| Switch Transformers 相較 T5-XXL 的預訓練加速倍數 | 4 倍 | CITE:E6 |
Hugging Face揭露,Switch Transformers相較於T5-XXL在預訓練速度上達成4倍加速CITE:E6。這項數據與Mixtral的啟動參數落差(129億對467億)共同構成MoE架構在訓練與推論兩端的效率證據。
綜合以上證據,MoE架構的稀疏啟動機制讓Mixtral在467億總參數規模下,單一輸入只需動用129億個啟動參數,並由路由網路從8個專家中選出2個實際運算;而在訓練端,Switch Transformers相較T5-XXL達成4倍的預訓練加速。這些數字共同指向同一件事:MoE把「參數規模」與「運算成本」拆成兩個可分別調整的變數,而非兩者必然同步增長。
MoE架構藉由強制稀疏性,讓模型不必為每個輸入token啟動整個神經網路,因而能在運算成本幾乎不變的情況下擴大模型容量CITE:E1。IBM說明,這種「不啟動整個神經網路」的設計,是MoE方法區別於傳統模型的核心優勢CITE:E1。
在Mixtral架構中,路由網路會從多組專家中選出兩組來處理每一個token,並將其輸出相加結合CITE:E4。Hugging Face進一步說明,MoE模型雖然可能擁有大量參數,但推論時只會用到其中一部分CITE:E5。這代表模型的「總參數」與「實際運算所需的參數」是兩個可以被拆開的變數。
Mistral AI的Mixtral 8x7B語言模型,每一層由8個前饋區塊(即專家)組成,每個專家各擁有70億個參數CITE:E2。這8個專家並非同時全部運算,而是依前述路由機制,每次由路由網路挑選其中2個專家處理輸入的tokenCITE:E4。
Mixtral的每個輸入token雖可存取467億個參數,但實際處理單一範例時僅使用129億個啟動參數CITE:E3。這項數字呼應了Hugging Face的說明:MoE模型的參數規模雖大,推論階段實際啟用的僅是其中一部分CITE:E5。
MoE的價值不在參數總量本身,而在於路由機制把「容量」與「運算成本」這兩個原本綁定的變數拆開。Mixtral以467億總參數換取129億啟動參數的設計,加上Switch Transformers相較T5-XXL達成的4倍預訓練加速,都指向同一個工程判斷:稀疏啟動是目前擴大模型規模、同時控制成本的直接路徑。後續值得持續追蹤的指標,是啟動參數與總參數的比例(如Mixtral的129億/467億)在模型規模進一步擴大時是否維持穩定,這將決定稀疏化帶來的效率能否延續。
中華車旗下綠捷發表四足機器人GT5X與GT3X,訂定2027年在地自製率100%目標;團隊由原中華汽車人馬轉任、逾15年車用技術經驗,並分別與恩嘉科技、輝達NVIDIA、台塑新智能合作AI運算與電池系統。
Nvidia於2026年9月3日確認以129.3億美元(精確金額12,930,300,000美元)收購開源AI平台Hugging Face,該平台擁有逾1,800萬開發者、300萬個模型與50萬個資料集;收購金額較其2023年45億美元估值大幅墊高。
輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。