AI快訊

Meta 發布 Muse Code 編程代理與 Muse Spark 1.2:基準測試落後 Claude Opus 5,靠低價貢獻者層定價搶市場

N
Nathan科技編輯 · 技術負責人
發布 · 更新
根據TechCrunch與VentureBeat報導,Meta於8月5日推出終端機編程代理Muse Code測試版,並發布Muse Spark 1.2;該模型於Terminal-Bench得分82.9%,低於Claude Opus 5的86.7%,貢獻者層定價每百萬輸出token僅0.20美元。

Muse Code 是什麼,Meta 為何在此時推出它?

根據TechCrunch報導,Meta發布Muse Code,是一款鎖定大型程式碼庫的終端機編程AI代理,目前為公開測試版(beta)。Meta執行長Mark Zuckerberg於8月5日(週三)在社群貼文中表示,Muse Code能完成「跨大型程式碼庫的完整軟體工程任務」。

VentureBeat報導指出,Meta同日發布Muse Code測試版與Muse Spark 1.2,兩者合計讓Meta直接與Anthropic的Claude Code、OpenAI的Codex,以及日漸壯大的代理式編程工具陣營競爭。值得對照的是,原始Muse Spark已於2026年4月8日由Meta Superintelligence Labs發布,是Meta首款純雲端、不開放權重下載、不可自架的專有模型;VentureBeat稱此舉標誌著Llama開源時代的終結。當時Meta發言人被直接問及Llama後續開發時,僅回應「我們目前的Llama模型將繼續作為開源提供」,對未來模型保持沉默。

Muse Code 的核心功能與工作流程

Zuckerberg描述Muse Code的任務範圍,包括「規劃變更、撰寫程式碼、驗證結果」。根據TechCrunch報導,Muse Code可用單一指令安裝,並由Meta先前發布的編程模型Muse Spark驅動。

異步背景代理架構設計

VentureBeat引述Meta官方部落格說明,Muse Code採「持續運作」的異步背景代理設計:代理在整個工作階段中保持運作,而非為每個任務重新生成,藉此避免重複蒐集資訊,並自行決定何時向主代理回報進度。

此外,每一次模型呼叫、工具執行、核准與編輯,都會先寫入本地事件日誌才執行;VentureBeat報導稱,Meta形容這套單一事實來源設計讓運作「精確重播且安全重啟」。

Muse Spark 1.2 在多個基準測試中的表現與對標

VentureBeat彙整多項基準測試分數,顯示Muse Spark 1.2雖較前代進步,但仍未在多數測試中超車對手:

基準測試Muse Spark 1.2(於Muse Code運行)對手成績備註
SWE-Bench Verified(原始Muse Spark,2026年4月)77.4Claude Opus 4.6:80.8/Gemini 3.1 Pro:80.6落後兩者
Terminal-Bench 2.182.9%Claude Opus 5:86.7%(第一)/GPT-5.6 Terra:81.8%/Grok 4.5:81.6%領先GPT、Grok,落後Opus 5
DeepSWE 1.159.3%Opus 5:65.0%/GPT-5.6 Terra:64.8%排名第三
Meta內部編程基準70.6%GPT-5.6 Terra:65.4%/Gemini 3.6 Flash:63.9%/Opus 5:79.4%領先GPT、Gemini,落後Opus 5近9分

與前代1.1版相比,Muse Spark 1.2在Terminal-Bench提升6.7分,在DeepSWE提升6.3分。

Muse Code 的成本優勢與差異化定價模式

Meta AI負責人、Meta Superintelligence Labs主管Alexandr Wang向《華爾街日報》表示:「我們認為對許多工作流程與許多使用情境來說,這會是一個非常好的選項,尤其是從成本角度而言。」VentureBeat報導的定價結構顯示這句話背後的具體數字:

定價層級輸入(每百萬token)輸出(每百萬token)快取輸入速率限制資料是否用於訓練
標準層$1.25$4.25$0.153,000次/分鐘
貢獻者層$0.10$0.20$0.00260次/分鐘是(換取授權)

貢獻者層的輸入與輸出價格,分別較標準層便宜約12倍與21倍,代價是使用者須同意將提示詞與生成結果用於訓練Meta未來的模型。VentureBeat指出,貢獻者層遠低於標準層的速率限制,顯示該方案針對個人與小型實驗場景,而非生產環境負載。

安裝部署與可用性體驗

VentureBeat報導稱,Muse Code是一套完整的執行環境(harness),可透過單行curl指令在macOS或Linux上安裝,與驅動它的模型共同訓練,且與背後的Muse Spark模型一樣,完全屬於Meta專有技術。

VentureBeat在Mac mini上實測安裝流程:一行安裝指令運作正常,下載檔案為97MB,登入流程也順利完成,但代理最終未能實際執行任何工作——系統回報找不到可見的模型,且需要「完成帳戶設定所需的付款」才能繼續使用。

Muse Spark 1.2 的實際應用表現與硬體訓練優化

Zuckerberg表示,在測試中,Muse Code同時為一款遊戲建置六項功能,且沒有發生衝突。另一項測試中,Meta讓Muse Spark 1.2針對GPU核心優化任務,在輝達(NVIDIA)Hopper硬體上運行超過1,000次工具呼叫,持續時間長達24小時。

Meta 進軍企業 AI 與開源生態的長期戰略

VentureBeat報導指出,Meta今年6月已跨出核心的廣告業務焦點,推出鎖定客服支援場景的企業AI代理,正式進軍企業AI市場。

在開源議題上,截至2026年初,Llama系列模型的累積下載量約達12億次,平均每天約100萬次下載;但截至2025年底,來自DeepSeek、阿里巴巴與智譜AI的中國開源模型,在Hugging Face上的下載量佔比已攀升至約41%,侵蝕Llama在其開創的開源運動中的領導地位。對於Muse Code或Muse Spark是否會走向開源,Zuckerberg在X上回覆提問時僅表示:「稍後會有更多消息分享。」

這代表什麼

把基準測試與定價數字並列可以看到一個張力:Muse Spark 1.2在Terminal-Bench(82.9% vs. 86.7%)、Meta內部基準(70.6% vs. 79.4%)與DeepSWE(59.3% vs. 65.0%)上都落後Claude Opus 5,但貢獻者層定價僅為標準層的12分之1至21分之1,條件是使用者同意資料用於訓練。這項定價設計,發生在Meta自2026年4月8日起終止開放Muse Spark權重下載、轉向純雲端專有模型之後;而彼時Llama累積下載量雖已達12億次,其在開源生態的地位卻已面臨中國模型41%下載佔比的侵蝕。三組數字擺在一起,呈現的是一家在性能指標上尚未領先、卻在定價與資料策略上做出明確選擇的公司。

📊 證據與數據

常見問題

Muse Code 或 Muse Spark 未來會開源嗎?

根據VentureBeat報導,Zuckerberg在X上被問及此問題時僅回應「稍後會有更多消息分享」;目前Muse Code與Muse Spark系列模型皆為Meta的專有技術,尚未開放權重下載。

Muse Code 怎麼安裝?

根據TechCrunch與VentureBeat報導,Muse Code可用單一指令安裝(在macOS或Linux上透過curl指令),由Meta先前發布的Muse Spark模型驅動;VentureBeat實測下載檔案為97MB,但需綁定付款方式才能完成帳戶設定並實際運作。

📎 資料來源

  1. techcrunch.com
  2. venturebeat.com
N
Nathan科技編輯 · 技術負責人

相關文章