中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
Leviathan 等人(Google Research)提出推測解碼,由草稿模型產生候選 token,目標模型驗證CITE:E1。此演算法的核心定義是讓自回歸模型(Autoregressive Model)的抽樣速度加快,且不改變輸出結果,做法是平行計算多個 tokenCITE:E1。
Hugging Face 稱這套做法為「輔助生成」(Assisted Generation),實際流程是先由助手(草稿)模型以貪婪解碼(Greedy Decoding)產生一定數量的候選 tokenCITE:E7。
NVIDIA Developer Blog 進一步說明目標模型驗證階段的運作方式:目標模型會在單次前向傳遞(Forward Pass)中,同時處理輸入序列與所有草稿 token,為每個位置計算機率分布CITE:E6。
Chen 等人(DeepMind)提出改良版拒絕抽樣,在硬體數值範圍內維持目標模型分布不變CITE:E4。他們在 2023 年發表的論文說明,推測抽樣(Speculative Sampling)搭配一種改良的拒絕抽樣(Rejection Sampling)方法,可在硬體數值範圍內保持目標模型的分布不變CITE:E4。這意味著草稿模型提出的候選 token 若被拒絕,系統會依此機制重新抽樣,而不會讓最終輸出偏離目標模型原本會產生的結果。
推測解碼在 T5-XXL 與 700 億參數 Chinchilla 上分別達到 2X–3X 與 2–2.5x 解碼加速CITE:E2CITE:E5。兩篇論文分別在不同規模的模型上做了測試:
| 模型 | 參數規模 | 加速倍數 | 測試條件 | 來源 |
|---|---|---|---|---|
| T5-XXL | 未揭露(對照標準 T5X 實作) | 2X–3X | 輸出與標準 T5X 實作完全相同 | CITE:E2 |
| Chinchilla | 700 億 | 2–2.5x | 分散式設定,不犧牲樣本品質、不修改模型本身 | CITE:E5 |
Leviathan 等人在 T5-XXL 上的實驗顯示,相較標準 T5X 實作可達到 2X 至 3X 加速,且輸出完全相同CITE:E2。Chen 等人則在 700 億參數的 Chinchilla 上進行基準測試,於分散式設定下達到 2 至 2.5 倍解碼加速,且不犧牲樣本品質、不修改模型本身CITE:E5。
Chen 等人指出,草稿模型產生短續寫的平行評分延遲,與目標模型單一 token 抽樣延遲相當CITE:E3。這項觀察是整套演算法得以加速的關鍵:由較快但較弱的草稿模型產生短續寫,對其進行平行評分所花費的延遲,與直接從較大的目標模型抽樣單一 token 的延遲相當CITE:E3。換句話說,目標模型驗證多個候選 token 的成本,與它自行產生一個 token 的成本相近,因此整體流程能在不增加目標模型負擔的前提下,一次確認多個 token。
這代表什麼
Google Research 與 DeepMind 兩個研究團隊,分別在 2022 年與 2023 年獨立提出相近的機制:草稿模型先提案、目標模型單次平行驗證,並透過改良拒絕抽樣保持輸出分布不變CITE:E1CITE:E3CITE:E4。從小規模的 T5-XXL 到 700 億參數的 Chinchilla,兩種量級的模型都測得 2 倍以上的解碼加速CITE:E2CITE:E5。到了 2023 年與 2025 年,Hugging Face 與 NVIDIA 的技術文件分別記錄了這套機制在輔助生成工具與生產環境推論中的實作方式CITE:E7CITE:E6,顯示這項技術已從研究論文走進實際工具鏈。
Leviathan 等人(Google Research)提出推測解碼,由草稿模型產生候選 token,目標模型驗證CITE:E1。此演算法的核心定義是讓自回歸模型(Autoregressive Model)的抽樣速度加快,且不改變輸出結果,做法是平行計算多個 tokenCITE:E1。
Chen 等人(DeepMind)提出改良版拒絕抽樣,在硬體數值範圍內維持目標模型分布不變CITE:E4。他們在 2023 年發表的論文說明,推測抽樣(Speculative Sampling)搭配一種改良的拒絕抽樣(Rejection Sampling)方法,可在硬體數值範圍內保持目標模型的分布不變CITE:E4。
推測解碼在 T5-XXL 與 700 億參數 Chinchilla 上分別達到 2X–3X 與 2–2.5x 解碼加速CITE:E2CITE:E5。兩篇論文分別在不同規模的模型上做了測試:
Chen 等人指出,草稿模型產生短續寫的平行評分延遲,與目標模型單一 token 抽樣延遲相當CITE:E3。這項觀察是整套演算法得以加速的關鍵:由較快但較弱的草稿模型產生短續寫,對其進行平行評分所花費的延遲,與直接從較大的目標模型抽樣單一 token 的延遲相當CITE:E3。
推測解碼的價值不在單一加速倍數,而在於同一套「草稿模型提案、目標模型平行驗證」機制,經 Google Research 與 DeepMind 兩個獨立團隊,分別在 T5-XXL 與 700 億參數 Chinchilla 上都測得 2 倍以上加速,且靠改良拒絕抽樣保證輸出分布不變,顯示這項技術具備跨規模的可複製性。接下來要看的是 Hugging Face 與 NVIDIA 已寫進工具鏈的實作,在正式生產推論中回報的加速倍數是否仍落在 2 至 3 倍區間內。
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
Sony Music Publishing、Warner Chappell等多家音樂出版商於2026年8月28日晚間向加州北區地方法院對Anthropic提起訴訟,並將共同創辦人Dario Amodei、Benjamin Mann列為個人被告,求償每件作品最高15萬美元,總額上看數十億美元。
Anthropic今年8月接連與Lambda簽下350億美元、與Nscale簽下450億美元算力合約,兩案的資料中心與晶片皆與輝達相關:輝達是Lambda股東與晶片供應商,也是Nscale的投資方,並被外媒指為德州資料中心租戶。