中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
結構化狀態空間模型是為解決Transformer長序列計算低效而生CITE:E3。Gu 與 Dao 在論文中指出,線性注意力、閘控卷積與循環模型、結構化狀態空間模型(SSM)等多種次二次時間(subquadratic-time)架構,皆是為了解決Transformer在長序列上的計算低效問題而開發,但在語言等重要模態上的表現不如注意力機制CITE:E3。Hugging Face 文件進一步說明,Mamba是一種選擇性結構化狀態空間模型,設計目的即在規避Transformer處理長序列時的計算低效CITE:E4。
Mamba讓SSM參數成為輸入的函數,依當前token選擇性傳遞或遺忘資訊CITE:E1。Gu 與 Dao 指出,單純讓SSM參數成為輸入的函數,便能解決SSM在離散模態上的弱點,使模型能沿序列長度維度、依當前token選擇性地傳遞或遺忘資訊CITE:E1。
Mamba推論吞吐量達Transformer的5倍,且運算量隨序列長度線性成長CITE:E2。
| 指標 | Mamba | 自注意力機制(Transformer) |
|---|---|---|
| 推論吞吐量(相對值) | 5倍 | 1倍(基準) |
| 序列長度加倍時的運算/記憶體需求 | 約2倍 | 約4倍 |
| 已驗證可擴展的序列長度 | 百萬長度(真實資料) | 未提及 |
Gu 與 Dao 指出,Mamba具備快速推論能力,吞吐量為Transformer的5倍,並隨序列長度線性成長,其在真實資料上的表現可延伸至百萬長度序列CITE:E2。Hugging Face 文件同樣說明,Mamba具備快速推論能力,並能擴展至非常長的序列CITE:E5。PyTorch 團隊在部落格中指出,長序列可擴展性是Mamba類模型的一項關鍵優勢CITE:E6。該團隊並具體說明,序列長度加倍時,Mamba的運算與記憶體需求約略加倍,而自注意力機制則會變為四倍CITE:E7。
這代表什麼:從Gu與Dao的研究脈絡看,結構化狀態空間模型最初是為解決Transformer長序列計算低效而發展的次二次時間架構之一CITE:E3,而Mamba藉由讓SSM參數成為輸入函數、實現選擇性傳遞或遺忘資訊CITE:E1,同時取得了5倍推論吞吐量與序列長度加倍僅需2倍運算資源(相對自注意力的4倍)的具體效益CITE:E2CITE:E7。這與PyTorch團隊將長序列可擴展性列為Mamba類模型關鍵優勢的說法一致CITE:E6。
Mamba是一種選擇性結構化狀態空間模型(SSM)<CITE:E4>。
由Gu與Dao於2023年發表於arXiv<CITE:E1>。
Mamba真正解決的並非單純速度問題,而是先前次二次時間架構在語言等模態上表現不如注意力機制的瓶頸——讓SSM參數成為輸入的函數,才使選擇性傳遞或遺忘資訊變得可能。這也是為何官方數據強調的不只是5倍推論吞吐量,更是序列長度加倍時運算與記憶體需求僅增加2倍、而非自注意力的4倍:這個差距會隨序列長度拉長而持續放大。接下來值得觀察的具體指標,是Mamba在真實資料上百萬長度序列的表現是否持續改善。
中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。
Sony Music Publishing、Warner Chappell等多家音樂出版商於2026年8月28日晚間向加州北區地方法院對Anthropic提起訴訟,並將共同創辦人Dario Amodei、Benjamin Mann列為個人被告,求償每件作品最高15萬美元,總額上看數十億美元。
Anthropic今年8月接連與Lambda簽下350億美元、與Nscale簽下450億美元算力合約,兩案的資料中心與晶片皆與輝達相關:輝達是Lambda股東與晶片供應商,也是Nscale的投資方,並被外媒指為德州資料中心租戶。