AI專題

強化學習是什麼?從代理人試誤機制到 AlphaGo 圍棋對弈實證

林紀旭 James Lin總編輯
發布 · 更新
強化學習使自主代理人透過與環境互動、以試誤方式學習決策,目標為最大化累積獎勵;Google DeepMind 的 AlphaGo 便以此技術先以 5-0、後以 4-1 擊敗職業圍棋棋士,印證其實用性。

強化學習的基本概念:自主代理人如何透過環境互動學習決策?

IBM 定義強化學習為機器學習的一種流程,讓自主代理人透過與環境互動來學習做決策CITE:E1。這一學習過程仰賴試誤:代理人在沒有人類使用者指導的情況下,透過反覆嘗試學習如何執行任務CITE:E2。與監督式學習不同,強化學習不使用標示正確或錯誤行為的標記範例CITE:E3

代理人的目標與策略機制:獎勵如何驅動最優行為?

IBM 指出,代理人的唯一目標是最大化其從環境獲得的累積獎勵CITE:E4。Google 將此行為機制形式化為策略(policy):一個把對環境的觀察映射到代理人所要採取行動的函式CITE:E5。換言之,代理人並非依循人類預先標記的正確答案,而是透過策略函式反覆調整行動,以逼近最大化累積獎勵的目標。

AlphaGo 案例:強化學習如何在圍棋對弈中獲得實戰驗證?

Google DeepMind 的 AlphaGo 於首場 AI 對職業棋士賽事中以 5-0 獲勝CITE:E6。2016 年 3 月,AlphaGo 在南韓首爾的比賽中以 4-1 獲勝,吸引全球逾兩億人觀看CITE:E7

場次時間地點比數觀看人數
首場對弈20155-0
首爾對弈2016 年 3 月南韓首爾4-1逾 2 億人

這代表什麼:強化學習定義中「無人類指導、不使用標記範例」的試誤機制CITE:E2,與 AlphaGo 案例中代理人以最大化累積獎勵為目標CITE:E4並先後取得 5-0、4-1 戰績的結果CITE:E6相互呼應——一套僅靠環境互動與獎勵訊號學習的策略函式CITE:E5,確實能在圍棋這類高複雜度賽局中產生可驗證的具體成績,而 2016 年首爾對弈更以逾兩億人觀看的規模,把這項技術機制推到公開檢驗的舞台上CITE:E7

📊 證據與數據

常見問題

強化學習的基本概念:自主代理人如何透過環境互動學習決策?

IBM 定義強化學習為機器學習的一種流程,讓自主代理人透過與環境互動來學習做決策CITE:E1。這一學習過程仰賴試誤:代理人在沒有人類使用者指導的情況下,透過反覆嘗試學習如何執行任務CITE:E2。與監督式學習不同,強化學習不使用標示正確或錯誤行為的標記範例CITE:E3。

代理人的目標與策略機制:獎勵如何驅動最優行為?

IBM 指出,代理人的唯一目標是最大化其從環境獲得的累積獎勵CITE:E4。Google 將此行為機制形式化為策略(policy):一個把對環境的觀察映射到代理人所要採取行動的函式CITE:E5。換言之,代理人並非依循人類預先標記的正確答案,而是透過策略函式反覆調整行動,以逼近最大化累積獎勵的目標。

AlphaGo 案例:強化學習如何在圍棋對弈中獲得實戰驗證?

Google DeepMind 的 AlphaGo 於首場 AI 對職業棋士賽事中以 5-0 獲勝CITE:E6。2016 年 3 月,AlphaGo 在南韓首爾的比賽中以 4-1 獲勝,吸引全球逾兩億人觀看CITE:E7。

📎 資料來源

  1. ibm.com
  2. developers.google.com
  3. deepmind.google

延伸數據

作者觀點林紀旭 James Lin

AlphaGo 案例最值得留意的地方,是它把強化學習「最大化累積獎勵」這個抽象目標,轉化成可驗證的比賽成績:先是 5-0 拿下史上首場對弈,再於 2016 年首爾以 4-1 獲勝,且吸引逾兩億人觀看,等於把策略函式放進真實高風險賽局公開檢驗。相較於監督式學習依賴標記範例,這種不靠人類指導、純靠試誤學習的路徑,才是技術意義所在。後續若要判斷同類強化學習系統是否持續有效,可觀察的具體指標就是類似對弈場次的勝負比數,能否維持在 5-0、4-1 這樣的水準。

林紀旭 James Lin總編輯

相關文章

快訊

Google宣布在芬蘭投資130億歐元建置AI基礎設施

Google宣布2027至2028年將在芬蘭投資130億歐元(151億美元)建置AI基礎設施,為其歐洲最大單一投資案,涵蓋三處新建與一處擴建資料中心,並與Fortum簽署22年購電協議取得核電機組50%發電量。

EffectStory 編輯部 ·