中華車旗下綠捷推四足機器人GT5X、GT3X 拚2027年台灣自製率100%
中華車旗下綠捷發表四足機器人GT5X與GT3X,訂定2027年在地自製率100%目標;團隊由原中華汽車人馬轉任、逾15年車用技術經驗,並分別與恩嘉科技、輝達NVIDIA、台塑新智能合作AI運算與電池系統。
詞元(token)是機器在自然語言處理中能理解的語言單位,通常是一個詞或詞的一部分CITE:E1。這個定義是大型語言模型處理任何文字前,最基本的切分結果CITE:E1。
子詞分詞把文字切成介於詞與字元之間的單位,藉此讓詞彙表保持精簡,同時仍能捕捉有意義的片段CITE:E2。常見詞會維持為單一詞元,而罕見或未知詞則被拆解成子詞CITE:E3。這種做法讓模型不需要為每一個罕見詞單獨建立詞彙表項目,也能以既有子詞組合處理未曾見過的詞。
BPE(位元組對編碼)從個別字元開始,反覆合併出現頻率最高的相鄰字元對,逐步組成子詞與詞彙表CITE:E4。位元組層級 BPE 則改用 256 個位元組值作為基礎詞彙表,取代以字元為起點的做法CITE:E5。
Google 官方文件說明,以 Gemini 模型而言,一個詞元約等於 4 個字元CITE:E6。
| 換算項目 | 數值 | 來源 |
|---|---|---|
| Gemini 模型:1 詞元 | 約 4 個字元 | GoogleCITE:E6 |
| 詞元換算英文單字:100 詞元 | 約 60 到 80 個英文單字 | GoogleCITE:E7 |
| 位元組層級 BPE 基礎詞彙表 | 256 個位元組值 | Hugging FaceCITE:E5 |
這三組數字分別對應詞元與字元、詞元與英文單字,以及 BPE 演算法本身的基礎詞彙表規模,呈現詞元切分在不同層面的具體量化結果。
綜合以上證據可看出,子詞分詞的兩個層次彼此呼應:在演算法層面,位元組層級 BPE 以 256 個位元組值作為基礎詞彙表CITE:E5,讓常見詞維持完整、罕見詞被拆解為子詞CITE:E3;在實際使用層面,以 Gemini 模型計算,一個詞元約對應 4 個字元,100 個詞元約對應 60 到 80 個英文單字CITE:E6CITE:E7。這代表詞彙表大小的設計選擇,最終會反映在使用者實際感受到的詞元與文字換算比例上。
詞元(token)是機器在自然語言處理中能理解的語言單位,通常是一個詞或詞的一部分CITE:E1。這個定義是大型語言模型處理任何文字前,最基本的切分結果CITE:E1。
子詞分詞把文字切成介於詞與字元之間的單位,藉此讓詞彙表保持精簡,同時仍能捕捉有意義的片段CITE:E2。常見詞會維持為單一詞元,而罕見或未知詞則被拆解成子詞CITE:E3。這種做法讓模型不需要為每一個罕見詞單獨建立詞彙表項目,也能以既有子詞組合處理未曾見過的詞。
BPE(位元組對編碼)從個別字元開始,反覆合併出現頻率最高的相鄰字元對,逐步組成子詞與詞彙表CITE:E4。位元組層級 BPE 則改用 256 個位元組值作為基礎詞彙表,取代以字元為起點的做法CITE:E5。
Google 官方文件說明,以 Gemini 模型而言,一個詞元約等於 4 個字元CITE:E6。
位元組層級 BPE 把基礎詞彙表壓縮到 256 個位元組值,是子詞分詞在效率與涵蓋率之間取捨的具體做法;搭配 Gemini 模型「一個詞元約等於 4 字元、100 個詞元約等於 60 到 80 個英文單字」的換算比例,顯示詞彙表設計的抽象選擇,最終會落實成開發者實際感受到的輸入成本與輸出長度預算。常見詞維持單一詞元、罕見詞被拆解為子詞的機制,也意味著不同語言與詞彙分布會有不同的實際換算效率。接下來值得觀察的具體指標,是官方是否針對英文以外的語言,公布類似的詞元對字元換算比例。
中華車旗下綠捷發表四足機器人GT5X與GT3X,訂定2027年在地自製率100%目標;團隊由原中華汽車人馬轉任、逾15年車用技術經驗,並分別與恩嘉科技、輝達NVIDIA、台塑新智能合作AI運算與電池系統。
Nvidia於2026年9月3日確認以129.3億美元(精確金額12,930,300,000美元)收購開源AI平台Hugging Face,該平台擁有逾1,800萬開發者、300萬個模型與50萬個資料集;收購金額較其2023年45億美元估值大幅墊高。
輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。