Google宣布在芬蘭投資130億歐元建置AI基礎設施
Google宣布2027至2028年將在芬蘭投資130億歐元(151億美元)建置AI基礎設施,為其歐洲最大單一投資案,涵蓋三處新建與一處擴建資料中心,並與Fortum簽署22年購電協議取得核電機組50%發電量。
Google 研究團隊在論文中提出兩種神經網路架構,從大量文本計算出連續型詞向量CITE:E1。這篇 2013 年發表的論文,目標是從非常大量的文本資料集,計算出詞的連續向量表示CITE:E1。這兩種架構分別是連續詞袋模型(CBOW)與 Skip-gram,構成了 Word2Vec 方法的兩大支柱,也是後續詞嵌入研究的重要起點。
TensorFlow 官方文件說明,CBOW 模型依照周圍的上下文詞,反推句子中間的目標詞CITE:E4。也就是說,模型會先看到目標詞前後的一組鄰近詞,訓練任務是根據這些上下文詞,預測出被遮蔽在中間的那個目標詞;這個預測過程重複套用在大量句子上,逐步調整每個詞的向量參數。
TensorFlow 文件指出,Skip-gram 模型的方向與 CBOW 相反,是由給定的詞去預測其上下文CITE:E5。換言之,CBOW 的任務是「由上下文詞推目標詞」,Skip-gram 則是「由目標詞推上下文詞」,兩者互為鏡像的訓練任務,構成 Word2Vec 方法中可依語料特性選擇的兩種模型架構。
Google 研究團隊的實測顯示,Word2Vec 能在不到一天內,從 16 億詞的資料集學出高品質詞向量CITE:E2。這項結果說明,即便模型結構本身只是淺層神經網路,搭配大規模文本語料與高效的訓練方法,仍可在極短時間內完成學習,不需要深層網路架構也能得到品質良好的詞向量。
Google 研究團隊展示,King 減去 Man 再加上 Woman 所得向量,最接近 Queen 的詞向量CITE:E3。這個結果顯示詞向量空間存在線性的語意類比關係,能透過向量加減運算,捕捉詞語之間的對應關係。史丹佛大學 NLP 研究團隊則指出,兩個詞向量之間的歐氏距離(或餘弦相似度),能有效衡量對應詞語在語意或語言學上的相似程度CITE:E6。換句話說,語意相近的詞,在向量空間中的位置也會較為靠近。
史丹佛大學 NLP 研究團隊釋出的 GloVe 詞向量,以 300 維、220 萬詞彙、8400 億詞語料作為公開規格CITE:E7。其中以 Common Crawl 語料訓練的版本,包含 300 維(300d)向量、220 萬(2.2M)詞彙量,訓練語料規模達到 8400 億(840B)詞CITE:E7,提供了一組可供不同稠密詞向量方法對照的公開標準。
| 指標 | 數值 | 來源 |
|---|---|---|
| Word2Vec 訓練語料規模 | 16 億詞 | CITE:E2 |
| Word2Vec 訓練時間 | 不到一天 | CITE:E2 |
| GloVe 向量維度(Common Crawl 版) | 300 維 | CITE:E7 |
| GloVe 詞彙量 | 220 萬(2.2M) | CITE:E7 |
| GloVe 訓練語料規模 | 8400 億詞(840B) | CITE:E7 |
這代表什麼:綜合以上證據,Word2Vec 以 CBOW 與 Skip-gram 兩種淺層神經網路架構,在 16 億詞語料、不到一天內完成訓練CITE:E2,而其學出的詞向量能以線性運算捕捉 King、Man、Woman、Queen 之間的語意類比CITE:E3,也能以距離衡量詞語相似度CITE:E6。史丹佛大學 NLP 研究團隊釋出的 GloVe,以 300 維、220 萬詞彙、8400 億詞語料的規格CITE:E7,與 Word2Vec 的訓練規模並列來看,顯示稠密詞向量在維度與語料規模上,已形成可供不同方法相互對照的公開基準。
Google 研究團隊在論文中提出兩種神經網路架構,從大量文本計算出連續型詞向量CITE:E1。這篇 2013 年發表的論文,目標是從非常大量的文本資料集,計算出詞的連續向量表示CITE:E1。
TensorFlow 官方文件說明,CBOW 模型依照周圍的上下文詞,反推句子中間的目標詞CITE:E4。也就是說,模型會先看到目標詞前後的一組鄰近詞,訓練任務是根據這些上下文詞,預測出被遮蔽在中間的那個目標詞;這個預測過程重複套用在大量句子上,逐步調整每個詞的向量參數。
TensorFlow 文件指出,Skip-gram 模型的方向與 CBOW 相反,是由給定的詞去預測其上下文CITE:E5。換言之,CBOW 的任務是「由上下文詞推目標詞」,Skip-gram 則是「由目標詞推上下文詞」,兩者互為鏡像的訓練任務,構成 Word2Vec 方法中可依語料特性選擇的兩種模型架構。
Google 研究團隊的實測顯示,Word2Vec 能在不到一天內,從 16 億詞的資料集學出高品質詞向量CITE:E2。這項結果說明,即便模型結構本身只是淺層神經網路,搭配大規模文本語料與高效的訓練方法,仍可在極短時間內完成學習,不需要深層網路架構也能得到品質良好的詞向量。
Word2Vec用16億詞語料、不到一天完成訓練,得出能做線性語意運算的詞向量,這件事的意義在於:淺層神經網路架構加上足夠大的語料規模,就足以讓向量空間自然浮現King、Man、Woman、Queen這類類比關係,不需要額外的人工語意規則。CBOW與Skip-gram一個由上下文推目標詞、一個反過來由目標詞推上下文,提供了兩種可依語料特性選擇的訓練方向。接下來值得觀察的指標,是後繼方法如GloVe在維度(300維)與詞彙規模(220萬、8400億詞語料)上,是否持續把稠密向量的規格基準往上推。
Google宣布2027至2028年將在芬蘭投資130億歐元(151億美元)建置AI基礎設施,為其歐洲最大單一投資案,涵蓋三處新建與一處擴建資料中心,並與Fortum簽署22年購電協議取得核電機組50%發電量。
勤誠2026年8月營收達24.57億元,較去年同期成長40.5%,較7月則下滑0.2%;累計前8月營收198.48億元,年增51.7%。
彰化銀行公布,前8月稅後盈餘155億元(精確155.67億元),年增23.21%,EPS達1.29元;獲利成長主要來自存放款與財富管理業務挹注,並持續推動雙翅膀策略、拓展信託版圖。