AI專題

BERT 深度雙向預訓練解析:Google 遮罩語言模型如何刷新 11 項 NLP 任務紀錄

N
Nathan科技編輯 · 技術負責人
發布 · 更新
Google 研究團隊提出的 BERT,透過在所有層同時利用左右脈絡進行深度雙向預訓練,並以遮罩語言模型與句序預測的雙任務設計完成訓練,在十一項自然語言處理任務創下新紀錄,GLUE 分數達到 80.5%。

什麼是 BERT 的「深度雙向」預訓練表示?

BERT 從深層神經網路最底層開始就同時運用左右脈絡表示詞義,因此屬於深度雙向表示CITE:E3。以「bank」一詞為例,BERT 會同時參照「I made a ... deposit」中該詞左右兩側的脈絡來表示它的語意,而這個雙向參照從網路最底層就開始,而非僅在最後階段才合併CITE:E3。這種設計的核心在於,BERT 是透過在所有層同時條件化左右兩側脈絡,從未標註文本預訓練出深層雙向表示CITE:E1。Hugging Face 的文件描述則指出,BERT 本質上是一個在未標註文本上預訓練的雙向 TransformerCITE:E7

BERT 的遮罩語言模型與句序預測如何運作?

BERT 以遮罩語言模型隨機遮蔽輸入中 15% 的詞,並同時訓練句序預測任務CITE:E4。具體作法是:先遮蔽輸入序列中 15% 的詞,再將整段序列送入一個深度雙向 Transformer 編碼器,最後只針對被遮蔽的詞進行預測CITE:E4。除了這項遮罩語言模型任務之外,BERT 在預訓練階段還會學習預測一個句子是否接續在另一句之後,也就是句序預測CITE:E7。這兩項任務合併訓練,讓模型同時學到詞元層級的雙向語意,以及句子與句子之間的關係CITE:E7

BERT-Base 與 BERT-Large 的架構參數有何差異?

BERT-Base 為 1.1 億參數,BERT-Large 為 3.4 億參數。兩者的架構規格如下:

模型層數隱藏維度注意力頭數參數量
BERT-Base12 層76812 個1.1 億(110M)CITE:E5
BERT-Large24 層102416 個3.4 億(340M)CITE:E6

可以看到,BERT-Large 的層數是 BERT-Base 的 2 倍(24 層對 12 層)、隱藏維度也從 768 提高到 1024、注意力頭數從 12 個增加到 16 個,參數量則從 1.1 億增加到 3.4 億CITE:E5CITE:E6

BERT 在自然語言處理任務上的實績如何?

BERT 在十一項自然語言處理任務創下新的最佳成績,並將 GLUE 分數推升至 80.5%CITE:E2。這個 80.5% 的 GLUE 分數,相較先前紀錄是 7.7 個百分點的絕對進步CITE:E2

這代表什麼?BERT 的實績數字與其架構設計互相呼應:同時運用左右脈絡的深度雙向預訓練CITE:E1CITE:E3,搭配遮罩 15% 詞元與句序預測的雙任務訓練CITE:E4CITE:E7,最終反映在十一項任務創新紀錄、GLUE 分數 80.5%、較先前進步 7.7 個百分點的成果上CITE:E2;而 BERT-Base 的 1.1 億參數與 BERT-Large 的 3.4 億參數CITE:E5CITE:E6,則說明這些成果是建立在不同規模的層數與隱藏維度配置之上。

📊 證據與數據

常見問題

什麼是 BERT 的「深度雙向」預訓練表示?

BERT 從深層神經網路最底層開始就同時運用左右脈絡表示詞義,因此屬於深度雙向表示CITE:E3。以「bank」一詞為例,BERT 會同時參照「I made a ... deposit」中該詞左右兩側的脈絡來表示它的語意,而這個雙向參照從網路最底層就開始,而非僅在最後階段才合併CITE:E3。

BERT 的遮罩語言模型與句序預測如何運作?

BERT 以遮罩語言模型隨機遮蔽輸入中 15% 的詞,並同時訓練句序預測任務CITE:E4。具體作法是:先遮蔽輸入序列中 15% 的詞,再將整段序列送入一個深度雙向 Transformer 編碼器,最後只針對被遮蔽的詞進行預測CITE:E4。

BERT-Base 與 BERT-Large 的架構參數有何差異?

BERT-Base 為 1.1 億參數,BERT-Large 為 3.4 億參數。兩者的架構規格如下:

BERT 在自然語言處理任務上的實績如何?

BERT 在十一項自然語言處理任務創下新的最佳成績,並將 GLUE 分數推升至 80.5%CITE:E2。這個 80.5% 的 GLUE 分數,相較先前紀錄是 7.7 個百分點的絕對進步CITE:E2。

📎 資料來源

  1. arxiv.org
  2. github.com
  3. huggingface.co

延伸數據

作者觀點Nathan

BERT 能把 GLUE 成績推升到 80.5%(較先前進步 7.7 個百分點),關鍵不在於架構本身多新穎,而在於它把同時運用左右脈絡與遮罩 15% 詞元兩項訓練設計綁在一起,讓雙向資訊滲透到每一層,而非事後拼接。BERT-Base 與 BERT-Large 之間 1.1 億到 3.4 億參數的落差,也顯示成績提升與層數、隱藏維度的擴大同步發生。後續值得追蹤的是:當同樣的雙向預訓練與遮罩機制套用到更大規模的模型時,參數量的擴增是否仍能維持相近幅度的分數躍進。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

Google宣布在芬蘭投資130億歐元建置AI基礎設施

Google宣布2027至2028年將在芬蘭投資130億歐元(151億美元)建置AI基礎設施,為其歐洲最大單一投資案,涵蓋三處新建與一處擴建資料中心,並與Fortum簽署22年購電協議取得核電機組50%發電量。

EffectStory 編輯部 ·