AI專題

Mamba 選擇性狀態空間模型:如何以線性複雜度替代自注意力機制

E
EffectStory 編輯部編輯部
發布 · 更新
Mamba是Gu與Dao提出的選擇性狀態空間模型,讓SSM參數隨輸入變化,依當前token選擇性傳遞或遺忘資訊;其推論吞吐量為Transformer的5倍,序列長度加倍時運算與記憶體需求僅增加2倍,自注意力則增加4倍,並可延伸至百萬長度序列。

Transformer 在長序列上的計算為何低效,為何需要狀態空間模型(SSM)?

結構化狀態空間模型是為解決Transformer長序列計算低效而生CITE:E3。Gu 與 Dao 在論文中指出,線性注意力、閘控卷積與循環模型、結構化狀態空間模型(SSM)等多種次二次時間(subquadratic-time)架構,皆是為了解決Transformer在長序列上的計算低效問題而開發,但在語言等重要模態上的表現不如注意力機制CITE:E3。Hugging Face 文件進一步說明,Mamba是一種選擇性結構化狀態空間模型,設計目的即在規避Transformer處理長序列時的計算低效CITE:E4

Mamba 的核心創新是什麼?如何讓 SSM 選擇性傳遞資訊?

Mamba讓SSM參數成為輸入的函數,依當前token選擇性傳遞或遺忘資訊CITE:E1。Gu 與 Dao 指出,單純讓SSM參數成為輸入的函數,便能解決SSM在離散模態上的弱點,使模型能沿序列長度維度、依當前token選擇性地傳遞或遺忘資訊CITE:E1

Mamba 相比自注意力機制有哪些效能優勢?

Mamba推論吞吐量達Transformer的5倍,且運算量隨序列長度線性成長CITE:E2

指標Mamba自注意力機制(Transformer)
推論吞吐量(相對值)5倍1倍(基準)
序列長度加倍時的運算/記憶體需求約2倍約4倍
已驗證可擴展的序列長度百萬長度(真實資料)未提及

Gu 與 Dao 指出,Mamba具備快速推論能力,吞吐量為Transformer的5倍,並隨序列長度線性成長,其在真實資料上的表現可延伸至百萬長度序列CITE:E2。Hugging Face 文件同樣說明,Mamba具備快速推論能力,並能擴展至非常長的序列CITE:E5。PyTorch 團隊在部落格中指出,長序列可擴展性是Mamba類模型的一項關鍵優勢CITE:E6。該團隊並具體說明,序列長度加倍時,Mamba的運算與記憶體需求約略加倍,而自注意力機制則會變為四倍CITE:E7

這代表什麼:從Gu與Dao的研究脈絡看,結構化狀態空間模型最初是為解決Transformer長序列計算低效而發展的次二次時間架構之一CITE:E3,而Mamba藉由讓SSM參數成為輸入函數、實現選擇性傳遞或遺忘資訊CITE:E1,同時取得了5倍推論吞吐量與序列長度加倍僅需2倍運算資源(相對自注意力的4倍)的具體效益CITE:E2CITE:E7。這與PyTorch團隊將長序列可擴展性列為Mamba類模型關鍵優勢的說法一致CITE:E6

📊 證據與數據

常見問題

Mamba是什麼類型的模型?

Mamba是一種選擇性結構化狀態空間模型(SSM)<CITE:E4>。

Mamba論文由誰、何時發表?

由Gu與Dao於2023年發表於arXiv<CITE:E1>。

📎 資料來源

  1. arxiv.org
  2. huggingface.co
  3. pytorch.org

延伸數據

作者觀點EffectStory 編輯部

Mamba真正解決的並非單純速度問題,而是先前次二次時間架構在語言等模態上表現不如注意力機制的瓶頸——讓SSM參數成為輸入的函數,才使選擇性傳遞或遺忘資訊變得可能。這也是為何官方數據強調的不只是5倍推論吞吐量,更是序列長度加倍時運算與記憶體需求僅增加2倍、而非自注意力的4倍:這個差距會隨序列長度拉長而持續放大。接下來值得觀察的具體指標,是Mamba在真實資料上百萬長度序列的表現是否持續改善。

E
EffectStory 編輯部編輯部

相關文章

快訊

中央社MCP正式上線:台灣首個新聞用「AI的USB-C」如何運作

中央社於2026年8月31日推出台灣首個新聞用模型上下文協定工具「AskCNA」,整合近500萬則新聞稿、350萬張照片與150個政府機關公開資料,月訂閱新台幣200元,供Claude、ChatGPT、Grok等AI平台即時查證且強制標註出處。

EffectStory 編輯部 ·