AI專題

思維鏈提示(Chain-of-Thought):讓語言模型先想清楚再回答的推理技術

林紀旭 James Lin總編輯
發布 · 更新
思維鏈提示讓模型在給出答案前,先產生一連串中間推理步驟。IBM與Hugging Face說明其運作原理,Google研究團隊實測顯示,以8個範例提示5,400億參數模型,在GSM8K數學題基準上達到最先進準確率,超越加了驗證器的微調GPT-3。

思維鏈是什麼?如何定義及運作原理?

IBM說明,思維鏈提示模擬人類推理過程,將複雜問題拆解為可管理、依序導向最終答案的中間步驟CITE:E6。Hugging Face則指出,思維鏈是透過提供一系列提示,讓模型更徹底地「思考」主題,藉此產生更連貫且有充分推理的輸出CITE:E7。兩者的說明角度不同——IBM著重「拆解步驟」的結構,Hugging Face著重「引導思考」的過程——但共同指向同一件事:答案不是一步到位產生的,而是先經過一連串可見的中間推理。

思維鏈如何改善大型語言模型的推理能力?

Google研究團隊發現,產生思維鏈能顯著提升大型語言模型執行複雜推理的能力CITE:E1。IBM補充說明,思維鏈是一種提示工程技術,特別能增強大型語言模型在涉及多步推理的複雜任務上的輸出CITE:E5。換言之,同一項技術從學術實驗與產業說明兩個角度被驗證:一邊是「顯著提升複雜推理能力」的實測結論,一邊是「針對多步推理任務」的技術定位。

思維鏈在哪些類型的任務上最有效?

Google研究團隊在三個大型語言模型上的實驗顯示,思維鏈提示可提升算術、常識與符號推理任務的表現CITE:E4。這代表思維鏈的效果並非侷限於單一任務類型,而是橫跨三種不同性質的推理需求——需要計算的算術題、需要生活常識的判斷題,以及需要符號操作的邏輯題。

思維鏈提示的實踐應用方式——以少數幾個範例啟動能力

Google研究團隊說明,這類推理能力會在足夠大的語言模型中自然浮現,方法是在提示中提供少數幾個思維鏈示範作為範例CITE:E2。這裡的關鍵字是「足夠大」與「少數幾個」:研究團隊並未描述透過額外訓練或微調來取得這項能力,而是描述一種「在提示中放入範例」的簡單方法,前提是模型規模本身已經達到一定門檻。

思維鏈在大規模模型上的實證成效——以 GSM8K 基準為例

Google研究團隊以僅僅8個思維鏈範例提示一個5,400億參數模型,即在GSM8K數學文字題基準上達到最先進準確率CITE:E3。這項成果甚至超越了加了驗證器的微調GPT-3CITE:E3。對照前述「足夠大的模型中自然浮現」的說法,這組數據具體標出了那個「足夠大」的量級,以及「少數範例」具體是多少個。

這代表什麼

IBM與Hugging Face對思維鏈機制的說明,共同指向同一個運作方式:讓模型在給出答案前,先產生依序推進的中間推理步驟CITE:E6CITE:E7。Google研究團隊的實證數據進一步把這個機制量化——這種推理能力要在「足夠大」的語言模型中才會自然浮現,而僅以8個範例提示5,400億參數模型,便足以在GSM8K基準上超越加了驗證器的微調GPT-3CITE:E2CITE:E3。對照三個大型語言模型在算術、常識、符號推理任務上的提升,以及思維鏈作為多步推理任務提示工程技術的定位,這些證據共同呈現的是模型規模與範例引導兩者共同作用的結果,而非單一提示詞技巧本身CITE:E4CITE:E5

📊 證據與數據

常見問題

思維鏈是什麼?如何定義及運作原理?

IBM說明,思維鏈提示模擬人類推理過程,將複雜問題拆解為可管理、依序導向最終答案的中間步驟CITE:E6。Hugging Face則指出,思維鏈是透過提供一系列提示,讓模型更徹底地「思考」主題,藉此產生更連貫且有充分推理的輸出CITE:E7。

思維鏈如何改善大型語言模型的推理能力?

Google研究團隊發現,產生思維鏈能顯著提升大型語言模型執行複雜推理的能力CITE:E1。IBM補充說明,思維鏈是一種提示工程技術,特別能增強大型語言模型在涉及多步推理的複雜任務上的輸出CITE:E5。

思維鏈在哪些類型的任務上最有效?

Google研究團隊在三個大型語言模型上的實驗顯示,思維鏈提示可提升算術、常識與符號推理任務的表現CITE:E4。這代表思維鏈的效果並非侷限於單一任務類型,而是橫跨三種不同性質的推理需求——需要計算的算術題、需要生活常識的判斷題,以及需要符號操作的邏輯題。

📎 資料來源

  1. arxiv.org
  2. ibm.com
  3. huggingface.co

延伸數據

作者觀點林紀旭 James Lin

思維鏈提示真正的關鍵不在提示詞的巧妙措辭,而在於它揭露了一個規模門檻:這種推理能力要在「足夠大」的語言模型中才會自然浮現,而不是任何規模的模型都能複製「8個範例提示5,400億參數模型、在GSM8K上超越加驗證器微調GPT-3」這樣的結果。這代表思維鏈更接近喚醒模型既有能力的鑰匙,而非額外訓練出新能力的方法。後續可觀察的具體指標是:同樣的少量範例提示,拿到遠低於5,400億參數的模型上,能否複製出算術、常識、符號推理任務上的同等提升——這將決定思維鏈是「規模的產物」還是「方法本身可獨立成立」。

林紀旭 James Lin總編輯

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·