AI專題

RLHF 三步驟拆解:OpenAI InstructGPT 如何用人類回饋讓語言模型貼近人類意圖

林紀旭 James Lin總編輯
發布 · 更新
人類回饋強化學習(RLHF)透過訓練獎勵模型、再以強化學習微調語言模型,使輸出貼近人類意圖。OpenAI 在 InstructGPT 研究中證實,經 RLHF 微調的13億參數模型輸出,勝過參數多100倍、達1750億的 GPT-3。

RLHF 的核心概念與目的是什麼?

IBM 定義,人類回饋強化學習(RLHF)是以人類直接回饋訓練出「獎勵模型」,再透過強化學習優化 AI 代理表現的機器學習技術CITE:E7。Hugging Face 進一步指出,RLHF 讓原本只在一般文本語料上訓練的語言模型,得以開始對齊複雜的人類價值CITE:E6。換言之,RLHF 要解決的問題,是讓模型輸出從「語言上通順」進一步貼近「人類真正想要的答案」。

RLHF 第一步:如何透過示範資料進行監督式微調?

OpenAI 在 InstructGPT 研究中,第一步是由標注者示範理想的模型行為,再以監督式學習微調 GPT-3CITE:E1。這批由人工撰寫的示範資料,構成後續獎勵模型訓練與強化學習的基礎起點,先讓模型學會「什麼是好答案的樣子」,再進入下一階段的偏好排序。

RLHF 第二步:獎勵模型如何從人類排序偏好中訓練?

Hugging Face 說明,獎勵模型的目標是讀入一段文字、回傳一個代表人類偏好的純量獎勵值CITE:E4。在此基礎上,OpenAI 蒐集了模型輸出的排序資料集,並以此進一步微調第一步產出的監督式模型CITE:E2。也就是說,人類不必逐字修改模型輸出,只需要對多個候選答案排序,這些排序資料就被轉換成獎勵模型可用的訓練訊號。

RLHF 第三步:PPO 演算法如何應用強化學習進行模型微調?

Hugging Face 指出,第三步是以近端策略最佳化(PPO)這種策略梯度強化學習演算法,微調初始語言模型副本的部分或全部參數CITE:E5。OpenAI 的做法即是用排序資料訓練出的獎勵模型作為訊號來源,透過強化學習從人類回饋進一步微調監督式模型CITE:E2。三步驟合起來,構成「示範資料監督式微調 → 排序偏好訓練獎勵模型 → PPO 強化學習微調」的完整鏈路。

RLHF 的實證成效:InstructGPT 案例如何驗證較小模型可超越大型基礎模型?

OpenAI 的實驗顯示,標注者偏好13億(1.3B)參數的 InstructGPT 輸出,勝過參數多出100倍、達1750億(175B)的 GPT-3CITE:E3

模型參數量標注者偏好結果
InstructGPT13億(1.3B)輸出較受標注者偏好
GPT-3(基礎模型)1750億(175B)參數多出100倍,輸出反而較不受偏好

這項對照直接來自同一份研究的標注者評比結果,呈現的是兩個模型在同一套人類偏好評分下的差距,而非跨案例比較。

這代表什麼

把 RLHF 的目的與 InstructGPT 的實證結果並列可以看到:RLHF 的設計目標是讓模型對齊複雜的人類價值CITE:E6,而 InstructGPT 案例顯示,經過示範資料監督式微調、獎勵模型排序訓練、PPO 強化學習三步驟後,一個參數量僅為基礎模型百分之一的模型,其輸出仍能在標注者評比中勝出CITE:E3。這意味著在這項實證中,對齊訓練流程本身,而非單純擴大參數規模,是輸出更受人類偏好的關鍵因素。

📊 證據與數據

常見問題

RLHF 的核心概念與目的是什麼?

IBM 定義,人類回饋強化學習(RLHF)是以人類直接回饋訓練出「獎勵模型」,再透過強化學習優化 AI 代理表現的機器學習技術CITE:E7。Hugging Face 進一步指出,RLHF 讓原本只在一般文本語料上訓練的語言模型,得以開始對齊複雜的人類價值CITE:E6。

RLHF 第一步:如何透過示範資料進行監督式微調?

OpenAI 在 InstructGPT 研究中,第一步是由標注者示範理想的模型行為,再以監督式學習微調 GPT-3CITE:E1。這批由人工撰寫的示範資料,構成後續獎勵模型訓練與強化學習的基礎起點,先讓模型學會「什麼是好答案的樣子」,再進入下一階段的偏好排序。

RLHF 第二步:獎勵模型如何從人類排序偏好中訓練?

Hugging Face 說明,獎勵模型的目標是讀入一段文字、回傳一個代表人類偏好的純量獎勵值CITE:E4。在此基礎上,OpenAI 蒐集了模型輸出的排序資料集,並以此進一步微調第一步產出的監督式模型CITE:E2。

RLHF 第三步:PPO 演算法如何應用強化學習進行模型微調?

Hugging Face 指出,第三步是以近端策略最佳化(PPO)這種策略梯度強化學習演算法,微調初始語言模型副本的部分或全部參數CITE:E5。OpenAI 的做法即是用排序資料訓練出的獎勵模型作為訊號來源,透過強化學習從人類回饋進一步微調監督式模型CITE:E2。

📎 資料來源

  1. arxiv.org
  2. huggingface.co
  3. ibm.com

延伸數據

作者觀點林紀旭 James Lin

這篇資料最值得留意的不是「RLHF 是什麼」,而是13億參數的 InstructGPT 在標注者評比中勝過參數多100倍的175B GPT-3 這個對照結果——它把「對齊訓練流程」與「參數規模」拆開來看,顯示示範資料監督式微調、獎勵模型排序訓練、PPO 強化學習這三步驟本身能帶來可觀的偏好提升,而不只是模型變大帶來的副產品。對想評估 RLHF 投入效益的團隊來說,值得追蹤的具體指標是同一模型在導入獎勵模型與 PPO 微調前後,標注者偏好比例的變化,而不只是參數規模的堆疊。

林紀旭 James Lin總編輯

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·