AI專題

分詞與 BPE(位元組對編碼):大型語言模型如何切分詞元、平衡詞彙表與未知詞

N
Nathan科技編輯 · 技術負責人
發布 · 更新
大型語言模型以詞元(token)為基本處理單位,子詞分詞讓常見詞維持完整、罕見詞拆解為子詞以控制詞彙表規模;位元組層級 BPE 以 256 個位元組值為基礎詞彙表,Gemini 模型中一個詞元約等於 4 字元,100 個詞元約等於 60 到 80 個英文單字。

什麼是詞元(Token)?

詞元(token)是機器在自然語言處理中能理解的語言單位,通常是一個詞或詞的一部分CITE:E1。這個定義是大型語言模型處理任何文字前,最基本的切分結果CITE:E1

子詞分詞如何平衡詞彙表大小與未知詞問題?

子詞分詞把文字切成介於詞與字元之間的單位,藉此讓詞彙表保持精簡,同時仍能捕捉有意義的片段CITE:E2。常見詞會維持為單一詞元,而罕見或未知詞則被拆解成子詞CITE:E3。這種做法讓模型不需要為每一個罕見詞單獨建立詞彙表項目,也能以既有子詞組合處理未曾見過的詞。

BPE(位元組對編碼)演算法與其變體是什麼?

BPE(位元組對編碼)從個別字元開始,反覆合併出現頻率最高的相鄰字元對,逐步組成子詞與詞彙表CITE:E4。位元組層級 BPE 則改用 256 個位元組值作為基礎詞彙表,取代以字元為起點的做法CITE:E5

詞元與字元、英文單詞的換算比例是多少?

Google 官方文件說明,以 Gemini 模型而言,一個詞元約等於 4 個字元CITE:E6

換算項目數值來源
Gemini 模型:1 詞元約 4 個字元GoogleCITE:E6
詞元換算英文單字:100 詞元約 60 到 80 個英文單字GoogleCITE:E7
位元組層級 BPE 基礎詞彙表256 個位元組值Hugging FaceCITE:E5

這三組數字分別對應詞元與字元、詞元與英文單字,以及 BPE 演算法本身的基礎詞彙表規模,呈現詞元切分在不同層面的具體量化結果。

綜合以上證據可看出,子詞分詞的兩個層次彼此呼應:在演算法層面,位元組層級 BPE 以 256 個位元組值作為基礎詞彙表CITE:E5,讓常見詞維持完整、罕見詞被拆解為子詞CITE:E3;在實際使用層面,以 Gemini 模型計算,一個詞元約對應 4 個字元,100 個詞元約對應 60 到 80 個英文單字CITE:E6CITE:E7。這代表詞彙表大小的設計選擇,最終會反映在使用者實際感受到的詞元與文字換算比例上。

📊 證據與數據

常見問題

什麼是詞元(Token)?

詞元(token)是機器在自然語言處理中能理解的語言單位,通常是一個詞或詞的一部分CITE:E1。這個定義是大型語言模型處理任何文字前,最基本的切分結果CITE:E1。

子詞分詞如何平衡詞彙表大小與未知詞問題?

子詞分詞把文字切成介於詞與字元之間的單位,藉此讓詞彙表保持精簡,同時仍能捕捉有意義的片段CITE:E2。常見詞會維持為單一詞元,而罕見或未知詞則被拆解成子詞CITE:E3。這種做法讓模型不需要為每一個罕見詞單獨建立詞彙表項目,也能以既有子詞組合處理未曾見過的詞。

BPE(位元組對編碼)演算法與其變體是什麼?

BPE(位元組對編碼)從個別字元開始,反覆合併出現頻率最高的相鄰字元對,逐步組成子詞與詞彙表CITE:E4。位元組層級 BPE 則改用 256 個位元組值作為基礎詞彙表,取代以字元為起點的做法CITE:E5。

詞元與字元、英文單詞的換算比例是多少?

Google 官方文件說明,以 Gemini 模型而言,一個詞元約等於 4 個字元CITE:E6。

📎 資料來源

  1. ibm.com
  2. huggingface.co
  3. ai.google.dev

延伸數據

作者觀點Nathan

位元組層級 BPE 把基礎詞彙表壓縮到 256 個位元組值,是子詞分詞在效率與涵蓋率之間取捨的具體做法;搭配 Gemini 模型「一個詞元約等於 4 字元、100 個詞元約等於 60 到 80 個英文單字」的換算比例,顯示詞彙表設計的抽象選擇,最終會落實成開發者實際感受到的輸入成本與輸出長度預算。常見詞維持單一詞元、罕見詞被拆解為子詞的機制,也意味著不同語言與詞彙分布會有不同的實際換算效率。接下來值得觀察的具體指標,是官方是否針對英文以外的語言,公布類似的詞元對字元換算比例。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·