AI專題

Word2Vec 與詞嵌入:CBOW 與 Skip-gram 如何用淺層神經網路學出稠密詞向量

E
EffectStory 編輯部編輯部
發布 · 更新
Word2Vec以CBOW與Skip-gram兩種淺層神經網路架構,從16億詞語料在不到一天內學出詞向量;King減Man加Woman的向量運算逼近Queen,顯示語意關係可由向量空間線性捕捉,GloVe則以300維、220萬詞彙的稠密向量與其對標。

Word2Vec 的核心創新與兩種模型架構是什麼?

Google 研究團隊在論文中提出兩種神經網路架構,從大量文本計算出連續型詞向量CITE:E1。這篇 2013 年發表的論文,目標是從非常大量的文本資料集,計算出詞的連續向量表示CITE:E1。這兩種架構分別是連續詞袋模型(CBOW)與 Skip-gram,構成了 Word2Vec 方法的兩大支柱,也是後續詞嵌入研究的重要起點。

CBOW 模型如何工作?它的訓練目標與上下文機制是什麼?

TensorFlow 官方文件說明,CBOW 模型依照周圍的上下文詞,反推句子中間的目標詞CITE:E4。也就是說,模型會先看到目標詞前後的一組鄰近詞,訓練任務是根據這些上下文詞,預測出被遮蔽在中間的那個目標詞;這個預測過程重複套用在大量句子上,逐步調整每個詞的向量參數。

Skip-gram 模型如何工作?與 CBOW 有何根本區別?

TensorFlow 文件指出,Skip-gram 模型的方向與 CBOW 相反,是由給定的詞去預測其上下文CITE:E5。換言之,CBOW 的任務是「由上下文詞推目標詞」,Skip-gram 則是「由目標詞推上下文詞」,兩者互為鏡像的訓練任務,構成 Word2Vec 方法中可依語料特性選擇的兩種模型架構。

Word2Vec 的訓練規模有多大?為什麼稱它「淺層神經網路」仍能高效學習?

Google 研究團隊的實測顯示,Word2Vec 能在不到一天內,從 16 億詞的資料集學出高品質詞向量CITE:E2。這項結果說明,即便模型結構本身只是淺層神經網路,搭配大規模文本語料與高效的訓練方法,仍可在極短時間內完成學習,不需要深層網路架構也能得到品質良好的詞向量。

學出的詞向量如何編碼語意關係?向量運算如何捕捉詞之間的類比與相似性?

Google 研究團隊展示,King 減去 Man 再加上 Woman 所得向量,最接近 Queen 的詞向量CITE:E3。這個結果顯示詞向量空間存在線性的語意類比關係,能透過向量加減運算,捕捉詞語之間的對應關係。史丹佛大學 NLP 研究團隊則指出,兩個詞向量之間的歐氏距離(或餘弦相似度),能有效衡量對應詞語在語意或語言學上的相似程度CITE:E6。換句話說,語意相近的詞,在向量空間中的位置也會較為靠近。

稠密詞向量的常見規格與規模標準是什麼?以 GloVe 為例如何對標?

史丹佛大學 NLP 研究團隊釋出的 GloVe 詞向量,以 300 維、220 萬詞彙、8400 億詞語料作為公開規格CITE:E7。其中以 Common Crawl 語料訓練的版本,包含 300 維(300d)向量、220 萬(2.2M)詞彙量,訓練語料規模達到 8400 億(840B)詞CITE:E7,提供了一組可供不同稠密詞向量方法對照的公開標準。

指標數值來源
Word2Vec 訓練語料規模16 億詞CITE:E2
Word2Vec 訓練時間不到一天CITE:E2
GloVe 向量維度(Common Crawl 版)300 維CITE:E7
GloVe 詞彙量220 萬(2.2M)CITE:E7
GloVe 訓練語料規模8400 億詞(840B)CITE:E7

這代表什麼:綜合以上證據,Word2Vec 以 CBOW 與 Skip-gram 兩種淺層神經網路架構,在 16 億詞語料、不到一天內完成訓練CITE:E2,而其學出的詞向量能以線性運算捕捉 King、Man、Woman、Queen 之間的語意類比CITE:E3,也能以距離衡量詞語相似度CITE:E6。史丹佛大學 NLP 研究團隊釋出的 GloVe,以 300 維、220 萬詞彙、8400 億詞語料的規格CITE:E7,與 Word2Vec 的訓練規模並列來看,顯示稠密詞向量在維度與語料規模上,已形成可供不同方法相互對照的公開基準。

📊 證據與數據

常見問題

Word2Vec 的核心創新與兩種模型架構是什麼?

Google 研究團隊在論文中提出兩種神經網路架構,從大量文本計算出連續型詞向量CITE:E1。這篇 2013 年發表的論文,目標是從非常大量的文本資料集,計算出詞的連續向量表示CITE:E1。

CBOW 模型如何工作?它的訓練目標與上下文機制是什麼?

TensorFlow 官方文件說明,CBOW 模型依照周圍的上下文詞,反推句子中間的目標詞CITE:E4。也就是說,模型會先看到目標詞前後的一組鄰近詞,訓練任務是根據這些上下文詞,預測出被遮蔽在中間的那個目標詞;這個預測過程重複套用在大量句子上,逐步調整每個詞的向量參數。

Skip-gram 模型如何工作?與 CBOW 有何根本區別?

TensorFlow 文件指出,Skip-gram 模型的方向與 CBOW 相反,是由給定的詞去預測其上下文CITE:E5。換言之,CBOW 的任務是「由上下文詞推目標詞」,Skip-gram 則是「由目標詞推上下文詞」,兩者互為鏡像的訓練任務,構成 Word2Vec 方法中可依語料特性選擇的兩種模型架構。

Word2Vec 的訓練規模有多大?為什麼稱它「淺層神經網路」仍能高效學習?

Google 研究團隊的實測顯示,Word2Vec 能在不到一天內,從 16 億詞的資料集學出高品質詞向量CITE:E2。這項結果說明,即便模型結構本身只是淺層神經網路,搭配大規模文本語料與高效的訓練方法,仍可在極短時間內完成學習,不需要深層網路架構也能得到品質良好的詞向量。

📎 資料來源

  1. arxiv.org
  2. arxiv.org
  3. tensorflow.org
  4. nlp.stanford.edu

延伸數據

作者觀點EffectStory 編輯部

Word2Vec用16億詞語料、不到一天完成訓練,得出能做線性語意運算的詞向量,這件事的意義在於:淺層神經網路架構加上足夠大的語料規模,就足以讓向量空間自然浮現King、Man、Woman、Queen這類類比關係,不需要額外的人工語意規則。CBOW與Skip-gram一個由上下文推目標詞、一個反過來由目標詞推上下文,提供了兩種可依語料特性選擇的訓練方向。接下來值得觀察的指標,是後繼方法如GloVe在維度(300維)與詞彙規模(220萬、8400億詞語料)上,是否持續把稠密向量的規格基準往上推。

E
EffectStory 編輯部編輯部

相關文章

快訊

Google宣布在芬蘭投資130億歐元建置AI基礎設施

Google宣布2027至2028年將在芬蘭投資130億歐元(151億美元)建置AI基礎設施,為其歐洲最大單一投資案,涵蓋三處新建與一處擴建資料中心,並與Fortum簽署22年購電協議取得核電機組50%發電量。

EffectStory 編輯部 ·