中華車旗下綠捷推四足機器人GT5X、GT3X 拚2027年台灣自製率100%
中華車旗下綠捷發表四足機器人GT5X與GT3X,訂定2027年在地自製率100%目標;團隊由原中華汽車人馬轉任、逾15年車用技術經驗,並分別與恩嘉科技、輝達NVIDIA、台塑新智能合作AI運算與電池系統。
IBM 定義,人類回饋強化學習(RLHF)是以人類直接回饋訓練出「獎勵模型」,再透過強化學習優化 AI 代理表現的機器學習技術CITE:E7。Hugging Face 進一步指出,RLHF 讓原本只在一般文本語料上訓練的語言模型,得以開始對齊複雜的人類價值CITE:E6。換言之,RLHF 要解決的問題,是讓模型輸出從「語言上通順」進一步貼近「人類真正想要的答案」。
OpenAI 在 InstructGPT 研究中,第一步是由標注者示範理想的模型行為,再以監督式學習微調 GPT-3CITE:E1。這批由人工撰寫的示範資料,構成後續獎勵模型訓練與強化學習的基礎起點,先讓模型學會「什麼是好答案的樣子」,再進入下一階段的偏好排序。
Hugging Face 說明,獎勵模型的目標是讀入一段文字、回傳一個代表人類偏好的純量獎勵值CITE:E4。在此基礎上,OpenAI 蒐集了模型輸出的排序資料集,並以此進一步微調第一步產出的監督式模型CITE:E2。也就是說,人類不必逐字修改模型輸出,只需要對多個候選答案排序,這些排序資料就被轉換成獎勵模型可用的訓練訊號。
Hugging Face 指出,第三步是以近端策略最佳化(PPO)這種策略梯度強化學習演算法,微調初始語言模型副本的部分或全部參數CITE:E5。OpenAI 的做法即是用排序資料訓練出的獎勵模型作為訊號來源,透過強化學習從人類回饋進一步微調監督式模型CITE:E2。三步驟合起來,構成「示範資料監督式微調 → 排序偏好訓練獎勵模型 → PPO 強化學習微調」的完整鏈路。
OpenAI 的實驗顯示,標注者偏好13億(1.3B)參數的 InstructGPT 輸出,勝過參數多出100倍、達1750億(175B)的 GPT-3CITE:E3。
| 模型 | 參數量 | 標注者偏好結果 |
|---|---|---|
| InstructGPT | 13億(1.3B) | 輸出較受標注者偏好 |
| GPT-3(基礎模型) | 1750億(175B) | 參數多出100倍,輸出反而較不受偏好 |
這項對照直接來自同一份研究的標注者評比結果,呈現的是兩個模型在同一套人類偏好評分下的差距,而非跨案例比較。
把 RLHF 的目的與 InstructGPT 的實證結果並列可以看到:RLHF 的設計目標是讓模型對齊複雜的人類價值CITE:E6,而 InstructGPT 案例顯示,經過示範資料監督式微調、獎勵模型排序訓練、PPO 強化學習三步驟後,一個參數量僅為基礎模型百分之一的模型,其輸出仍能在標注者評比中勝出CITE:E3。這意味著在這項實證中,對齊訓練流程本身,而非單純擴大參數規模,是輸出更受人類偏好的關鍵因素。
IBM 定義,人類回饋強化學習(RLHF)是以人類直接回饋訓練出「獎勵模型」,再透過強化學習優化 AI 代理表現的機器學習技術CITE:E7。Hugging Face 進一步指出,RLHF 讓原本只在一般文本語料上訓練的語言模型,得以開始對齊複雜的人類價值CITE:E6。
OpenAI 在 InstructGPT 研究中,第一步是由標注者示範理想的模型行為,再以監督式學習微調 GPT-3CITE:E1。這批由人工撰寫的示範資料,構成後續獎勵模型訓練與強化學習的基礎起點,先讓模型學會「什麼是好答案的樣子」,再進入下一階段的偏好排序。
Hugging Face 說明,獎勵模型的目標是讀入一段文字、回傳一個代表人類偏好的純量獎勵值CITE:E4。在此基礎上,OpenAI 蒐集了模型輸出的排序資料集,並以此進一步微調第一步產出的監督式模型CITE:E2。
Hugging Face 指出,第三步是以近端策略最佳化(PPO)這種策略梯度強化學習演算法,微調初始語言模型副本的部分或全部參數CITE:E5。OpenAI 的做法即是用排序資料訓練出的獎勵模型作為訊號來源,透過強化學習從人類回饋進一步微調監督式模型CITE:E2。
這篇資料最值得留意的不是「RLHF 是什麼」,而是13億參數的 InstructGPT 在標注者評比中勝過參數多100倍的175B GPT-3 這個對照結果——它把「對齊訓練流程」與「參數規模」拆開來看,顯示示範資料監督式微調、獎勵模型排序訓練、PPO 強化學習這三步驟本身能帶來可觀的偏好提升,而不只是模型變大帶來的副產品。對想評估 RLHF 投入效益的團隊來說,值得追蹤的具體指標是同一模型在導入獎勵模型與 PPO 微調前後,標注者偏好比例的變化,而不只是參數規模的堆疊。
中華車旗下綠捷發表四足機器人GT5X與GT3X,訂定2027年在地自製率100%目標;團隊由原中華汽車人馬轉任、逾15年車用技術經驗,並分別與恩嘉科技、輝達NVIDIA、台塑新智能合作AI運算與電池系統。
Nvidia於2026年9月3日確認以129.3億美元(精確金額12,930,300,000美元)收購開源AI平台Hugging Face,該平台擁有逾1,800萬開發者、300萬個模型與50萬個資料集;收購金額較其2023年45億美元估值大幅墊高。
輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。