中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
Hugging Face 說明,KV 快取會儲存先前 token 在注意力層算出的鍵值配對,供後續 token 直接取用而不必重算CITE:E1。NVIDIA 於 2023 年 11 月 17 日發布的技術文章進一步指出,為避免在每個時間步對所有 token 重算這些張量,可將其快取在 GPU 記憶體中,這正是加速逐字生成的關鍵CITE:E2。換言之,KV 快取用「空間換時間」——犧牲記憶體容量,換取每一步生成不必重跑整段序列的注意力計算。
NVIDIA 指出,KV 快取的記憶體需求會隨批次大小與序列長度線性成長CITE:E3。NVIDIA 在 2025 年 1 月 16 日發布的另一篇技術文章進一步指出,KV 快取同時隨語言模型大小、批次請求數與序列上下文長度三項因素線性成長CITE:E4。這代表記憶體壓力並非單一變數造成,而是模型規模、併發請求量與上下文長度三者疊加的結果。
Hugging Face 在 2024 年 5 月 16 日發布的文章表示,KV 快取雖能加速自回歸生成,但在長上下文或高批次情境下會成為記憶體瓶頸CITE:E5。此一說法與 NVIDIA 描述的線性成長曲線相互呼應:當序列長度或批次請求數持續增加,原本用來加速的快取本身,會反過來吃掉可用於運算的 GPU 記憶體空間。
Hugging Face 指出,在 80GB A100 上,量化後的 KV 快取搭配 Flash Attention 最多可支援 128k tokens,而半精度快取的上限僅為 40k tokensCITE:E6。以同一張 80GB A100 為基準換算,量化路線讓可支援的序列長度從 40k tokens 擴大到 128k tokens,達到約 3.2 倍。
vLLM 研究團隊在 2023 年 9 月 12 日發布的論文提出 PagedAttention,一種借鏡作業系統經典虛擬記憶體與分頁技術的注意力演算法CITE:E7。與量化路線壓縮每筆快取的位元寬度不同,PagedAttention 走的是記憶體管理層面的路線,借用作業系統管理實體記憶體的分頁概念,來處理 KV 快取的配置問題。
| 項目 | 數值 |
|---|---|
| 量化 KV 快取支援序列長度(80GB A100 + Flash Attention) | 128k tokens |
| 半精度 KV 快取支援序列長度(80GB A100) | 40k tokens |
| 測試 GPU 記憶體容量 | 80GB(A100) |
這代表什麼:Hugging Face 與 NVIDIA 分別在不同時間點的文件中描述了同一條因果鏈——KV 快取靠儲存鍵值配對換取生成速度CITE:E1CITE:E2,但這份快取會隨模型大小、批次數與序列長度線性膨脹CITE:E3CITE:E4,最終在長上下文或高批次場景下由加速手段變成瓶頸CITE:E5。量化CITE:E6與 PagedAttentionCITE:E7 是目前證據中出現的兩條緩解路線,分別對應「壓縮單筆快取體積」與「改善記憶體配置方式」,兩者處理的是同一個線性成長問題的不同層面。
Hugging Face 說明,KV 快取會儲存先前 token 在注意力層算出的鍵值配對,供後續 token 直接取用而不必重算CITE:E1。
Hugging Face 在 2024 年 5 月 16 日發布的文章表示,KV 快取雖能加速自回歸生成,但在長上下文或高批次情境下會成為記憶體瓶頸CITE:E5。此一說法與 NVIDIA 描述的線性成長曲線相互呼應:當序列長度或批次請求數持續增加,原本用來加速的快取本身,會反過來吃掉可用於運算的 GPU 記憶體空間。
Hugging Face 指出,在 80GB A100 上,量化後的 KV 快取搭配 Flash Attention 最多可支援 128k tokens,而半精度快取的上限僅為 40k tokensCITE:E6。
vLLM 研究團隊在 2023 年 9 月 12 日發布的論文提出 PagedAttention,一種借鏡作業系統經典虛擬記憶體與分頁技術的注意力演算法CITE:E7。
KV 快取的加速效果與記憶體代價其實是同一個機制的兩面:靠儲存鍵值配對省下重算時間,代價就是這份快取隨模型大小、批次數與序列長度線性堆積,最終從加速手段反轉為瓶頸。目前看到的兩條緩解路線並不互斥——量化壓縮每筆快取的位元寬度,PagedAttention 改用分頁式方式管理記憶體配置,分別作用在「體積」與「配置效率」兩個不同層面。實測數字上,量化路線在同一張 80GB A100 上把可支援序列長度從 40k 推到 128k tokens,約 3.2 倍差距;接下來值得觀察的是,若量化與分頁式記憶體管理疊加使用,這個倍數能否進一步擴大,這將直接決定同一張 GPU 能撐起多長的上下文視窗。
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
Sony Music Publishing、Warner Chappell等多家音樂出版商於2026年8月28日晚間向加州北區地方法院對Anthropic提起訴訟,並將共同創辦人Dario Amodei、Benjamin Mann列為個人被告,求償每件作品最高15萬美元,總額上看數十億美元。
Anthropic今年8月接連與Lambda簽下350億美元、與Nscale簽下450億美元算力合約,兩案的資料中心與晶片皆與輝達相關:輝達是Lambda股東與晶片供應商,也是Nscale的投資方,並被外媒指為德州資料中心租戶。