AI專題

LoRA低秩適應微調:凍結原模型、僅訓練少量低秩矩陣的技術原理

N
Nathan科技編輯 · 技術負責人
發布 · 更新
LoRA技術凍結預訓練模型原有權重,僅在Transformer各層注入少量可訓練的低秩矩陣進行微調;相較於以Adam微調的GPT-3 175B,可訓練參數量減少10,000倍、GPU記憶體需求降低3倍,效能與完整微調相當。

大語言模型微調成本與效率的挑戰:為什麼需要 LoRA?

部署多個各具1750億參數、各自獨立微調的GPT-3 175B模型實例,成本高昂到令人卻步CITE:E4。這是Hu等人(微軟)在提出LoRA(Low-Rank Adaptation,低秩適應)方法時所指出的核心痛點:當每一個下游任務都需要一份完整微調過的175B參數模型副本,部署與維運的成本會隨任務數量線性疊加,難以規模化。

LoRA 的技術核心:如何透過低秩分解實現高效參數調適?

LoRA會凍結預訓練模型的權重,並在Transformer架構的每一層注入可訓練的秩分解矩陣CITE:E1。Hugging Face PEFT文件進一步說明,LoRA的做法是以低秩分解產生的兩個較小矩陣(稱為更新矩陣)來表示權重更新,訓練這些新矩陣以適應新資料,同時讓原始權重矩陣維持凍結、不再接受任何調整CITE:E5。IBM對同一機制的描述是:LoRA不會重新訓練整個模型,而是將模型原有的權重與參數原封不動地凍結,再於原模型之上疊加稱為低秩矩陣的輕量元件,將其套用到新輸入以取得符合情境的結果CITE:E6。三方描述的共同點一致:原模型權重不動,真正被訓練的只有新增的低秩矩陣。

LoRA 相比傳統微調的參數與記憶體優勢有多大?

相較於以Adam微調的GPT-3 175B,LoRA可將可訓練參數量降低10,000倍、GPU記憶體需求降低3倍CITE:E2。這組數字直接對應第一節提出的部署成本問題:當可訓練參數量與記憶體需求同步下降,個別任務的微調與部署門檻也隨之降低。

指標完整微調(GPT-3 175B + Adam)導入 LoRA 後
可訓練參數量以175B參數全量訓練為基準降低10,000倍CITE:E2
GPU記憶體需求以完整微調所需記憶體為基準降低3倍CITE:E2

LoRA 在實務應用中的效能表現與推論效率如何?

LoRA在RoBERTa、DeBERTa、GPT-2與GPT-3上的模型品質與完整微調持平或更佳CITE:E3。Hu等人(微軟)同時指出,LoRA雖然可訓練參數更少,訓練吞吐量卻更高,且不像adapter方法會增加額外的推論延遲CITE:E3。換言之,參數與記憶體的節省並未以犧牲模型品質或拖慢推論速度作為代價。

GPT-3 175B規模的模型讓「每個任務都部署一份完整微調模型」的做法成本高昂到令人卻步,而LoRA凍結原始權重、只在Transformer各層注入低秩矩陣的做法,使可訓練參數量降低10,000倍、GPU記憶體需求降低3倍,同時在RoBERTa、DeBERTa、GPT-2與GPT-3上維持與完整微調持平或更佳的品質,且不像adapter方法會增加額外推論延遲——三組事實共同指向同一件事:規模與效率之間的取捨,在低秩分解的設計下不再是必然的兩難。

📊 證據與數據

常見問題

大語言模型微調成本與效率的挑戰:為什麼需要 LoRA?

部署多個各具1750億參數、各自獨立微調的GPT-3 175B模型實例,成本高昂到令人卻步CITE:E4。

LoRA 的技術核心:如何透過低秩分解實現高效參數調適?

LoRA會凍結預訓練模型的權重,並在Transformer架構的每一層注入可訓練的秩分解矩陣CITE:E1。

LoRA 相比傳統微調的參數與記憶體優勢有多大?

相較於以Adam微調的GPT-3 175B,LoRA可將可訓練參數量降低10,000倍、GPU記憶體需求降低3倍CITE:E2。這組數字直接對應第一節提出的部署成本問題:當可訓練參數量與記憶體需求同步下降,個別任務的微調與部署門檻也隨之降低。

LoRA 在實務應用中的效能表現與推論效率如何?

LoRA在RoBERTa、DeBERTa、GPT-2與GPT-3上的模型品質與完整微調持平或更佳CITE:E3。Hu等人(微軟)同時指出,LoRA雖然可訓練參數更少,訓練吞吐量卻更高,且不像adapter方法會增加額外的推論延遲CITE:E3。換言之,參數與記憶體的節省並未以犧牲模型品質或拖慢推論速度作為代價。

📎 資料來源

  1. arxiv.org
  2. huggingface.co
  3. ibm.com

延伸數據

作者觀點Nathan

LoRA的價值在於把微調從175B參數規模的全量調整,壓縮成只需訓練低秩矩陣的量級,10,000倍可訓練參數縮減與3倍GPU記憶體節省,直接決定中小團隊能否客製化大型語言模型。更關鍵的是,LoRA在RoBERTa、DeBERTa、GPT-2與GPT-3上維持與完整微調持平或更佳的品質且不增加推論延遲,並非「省成本卻犧牲品質」的權衡。接下來值得觀察的,是這項品質持平、延遲不變的特性能否在更多模型與任務上被重複驗證。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·