Claude Code自動模式8月14日起預設開啟,攔截率89%對比人工13.6%
根據TechCrunch報導,Anthropic宣布自2026年8月14日起,將自動模式設為Claude Code Pro、Max、Team帳號的預設權限模式;ITHome與Inside報導指出,研究顯示自動模式攔截89%有害操作,遠高於人工審查的13.6%。
Meta於2026年8月10日發布Muse Glimmer,是一款採用Apache 2.0授權的300億參數開放權重模型,設計目標是讓自主AI代理直接在消費級硬體上運行。根據VentureBeat報導,這是Meta繼2026年4月以閉源的Muse Spark取代開放權重的Llama系列後,首次完全開源發布,授權條款也比先前更為寬鬆。
Meta執行長Mark Zuckerberg在X發文宣布開放Glimmer權重,寫道:「今天我們也開放了Muse Glimmer的權重,這是一個可在本地運行的優秀300億參數稠密模型」,並預告「很快我們也將發布最新基礎模型Muse Spark 1.2的權重」。根據TechCrunch報導,Glimmer本質上是Meta最強大閉源模型Muse Spark(2026年4月推出)的開放版本——較強的Muse Spark仍為閉源,較小的Glimmer則可被下載、微調並在使用者硬體上運行。
根據VentureBeat取得的Hugging Face模型卡資訊,Glimmer是稠密因果transformer架構,含約296億(29.6B)總參數、52層,並內建一個約18億參數的ViT-G/14感知編碼器;上下文長度達131,072個token以上,知識截止日期為2026年1月4日。
Meta表示,全精度版本的300億參數模型需要超過55GB記憶體,因此開發了約4-bit的量化版本,將語言模型權重壓縮至20GB以下。Meta自行測得,鎖定32GB硬體的K-Quant-Dynamic版本在15項基準測試中平均準確度僅下降0.2%,鎖定24GB硬體的K-Quant-17GB版本則下降1%——VentureBeat特別註明,這些數字是Meta自家測量結果,並非獨立第三方評測。
Meta首席AI官Alexandr Wang在X發文表示,Glimmer「就像更大型的模型一樣,可透過規劃、工具呼叫、自我檢查結果與失敗復原,作為完整代理運作」,並補充該模型「可在24GB VRAM上運行,而不損失代理可靠性」。TechCrunch報導指出,Glimmer設計為可在搭載單一消費級GPU的Mac或PC上,本地執行呼叫工具、撰寫與除錯程式碼、處理檔案與截圖等多步驟任務,支援文字與圖像輸入,並以逾100種語言訓練。
Meta另採用名為DFlash的推測解碼技術加速生成:在輝達RTX 5090上,平均生成速度從每秒74.9個token提升至233.4個token,增幅3.1倍;蘋果M5 Max從每秒26.6個token提升至50.2個token,增幅1.8倍;蘋果M4 Max則從23.7提升至37.8個token,增幅1.5倍。
| 項目 | 數值 |
|---|---|
| 總參數 / 層數 | 約296億(29.6B)、52層 |
| 感知編碼器 | 約18億參數(ViT-G/14) |
| 上下文長度 | 131,072 token以上 |
| 知識截止日 | 2026年1月4日 |
| 全精度記憶體需求 | 逾55GB |
| 4-bit量化後記憶體 | 低於20GB(語言模型權重) |
| K-Quant-Dynamic(32GB硬體)準確度損失 | 0.2%(15項基準測試平均,Meta自測) |
| K-Quant-17GB(24GB硬體)準確度損失 | 1%(Meta自測) |
| 輝達RTX 5090生成速度(DFlash前→後) | 74.9→233.4 token/秒(3.1倍) |
| 蘋果M5 Max生成速度 | 26.6→50.2 token/秒(1.8倍) |
| 蘋果M4 Max生成速度 | 23.7→37.8 token/秒(1.5倍) |
根據VentureBeat取得的Meta自家評測,Glimmer在多項代理任務基準測試中領先Gemma4-31B與Qwen3.6-27B,包括MCP Atlas(75.5分)、DeepSearch QA(74.6分)、τ³-Banking(23.5分)、WildClawBench(47.6分)與GAIA2(43.3分)。在SWE-Bench Pro測試中,Glimmer得分51.2,高於Gemma4-31B的36.9,也高於Qwen3.6-27B的50.2。
但同一份評測顯示,Qwen3.6-27B在多項測試上領先Glimmer:OSWorld-Verified(75.6分 vs. Glimmer的65.9分)、TerminalBench 2.1(60.7分 vs. 51.7分)、GDPval-AA(1141分 vs. 953分),以及大多數多模態基準測試。在SWE-Bench Verified測試中,Glimmer得分76.0,僅略低於Qwen3.6-27B的77.2。
| 基準測試 | Muse Glimmer | Gemma4-31B | Qwen3.6-27B |
|---|---|---|---|
| SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 未提供 | 77.2 |
| OSWorld-Verified | 65.9 | 未提供 | 75.6 |
| TerminalBench 2.1 | 51.7 | 未提供 | 60.7 |
| GDPval-AA | 953 | 未提供 | 1141 |
此外,Glimmer在MCP Atlas(75.5)、DeepSearch QA(74.6)、τ³-Banking(23.5)、WildClawBench(47.6)、GAIA2(43.3)等測試中領先另兩款模型,但VentureBeat報導未提供Gemma4-31B與Qwen3.6-27B在這幾項測試上的具體分數。
在CI Memories隱私基準測試(違規率越低越好)中,Glimmer的違規率為26.4,高於Gemma的12.1,但低於Qwen的53.4。在Siren AgentDojo提示注入測試中,Glimmer的攻擊成功率為28.4%,高於Gemma的25.6%,但低於Qwen的40.3%;不過Glimmer的效用得分為三者中最高的94.2。
| 安全測試 | Muse Glimmer | Gemma | Qwen |
|---|---|---|---|
| CI Memories 違規率(越低越好) | 26.4 | 12.1 | 53.4 |
| Siren AgentDojo 攻擊成功率 | 28.4% | 25.6% | 40.3% |
| Siren AgentDojo 效用得分 | 94.2(三者最高) | 未提供 | 未提供 |
根據VentureBeat報導,Meta依其Advanced AI Scaling Framework評估Glimmer,認定該模型不符合框架所定義的「前沿AI」,原因是其能力普遍弱於Muse Spark。Meta的Preparedness Team在化學/生物、網路與失控三大類別中,將Glimmer的風險評估為中等或更低。
TechCrunch報導指出,Meta於週一(2026年8月10日)發布的Glimmer,提供了執行長Mark Zuckerberg所稱「個人超級智能」願景在實務上可能呈現樣貌的最清晰畫面。Zuckerberg在同日發表的新信函中重申此一願景,主張廣泛分配超級智能「有潛力開啟個人賦權的新時代,讓個人能運用這項強大的新能力,發揮全部潛能、追求興趣,並比以往任何時候都更能改善自己與世界的生活」。
在此願景下,Meta採取的路徑是:較強大的Muse Spark維持閉源,而規模較小的Glimmer則開放權重,可供下載、微調並在使用者自有硬體上運行。
Glimmer的權重目前已在Hugging Face上架。根據VentureBeat引述Alexandr Wang說法,本週起將透過Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI與OpenRouter等平台陸續提供支援。
這次開源發布的背景,是開放權重模型市場版圖已出現變化。根據OpenRouter的資料,截至2026年5月,中國開放權重模型佔該平台所有token消耗量的約61%,五大最常使用的模型中有四個來自中國實驗室;而Meta先前的開放權重代表作Llama,已完全跌出排行榜。
將前述事實並列可見幾層對照關係。首先是時間序列:Meta在Llama跌出OpenRouter排行榜、中國開放權重模型token消耗量攀升至約61%(截至2026年5月)之後,於2026年8月10日重新以Glimmer全面開源,授權比Llama時期更寬鬆的Apache 2.0。其次是效能定位:Glimmer在SWE-Bench Pro、MCP Atlas等多項代理測試領先Gemma4-31B與Qwen3.6-27B,但在OSWorld-Verified、TerminalBench 2.1、GDPval-AA等測試上落後Qwen3.6-27B,呈現互有領先而非全面壓倒的格局。第三是安全與效用的權衡:Glimmer的CI Memories違規率(26.4)與Siren AgentDojo攻擊成功率(28.4%)均介於Gemma與Qwen之間,但效用得分94.2為三者最高,顯示較高的任務有效性與較高的安全風險同時出現。最後,Meta在強調0.2%至1%的量化準確度損失時,VentureBeat特別註明這些數字是廠商自測而非獨立評測結果,提醒讀者性能宣稱與外部驗證之間仍存在落差。
根據VentureBeat報導,Glimmer權重已在Hugging Face上架,Alexandr Wang表示本週起將透過Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI與OpenRouter陸續提供支援。
根據TechCrunch報導,Glimmer本質上是Meta最強大閉源模型Muse Spark(2026年4月推出)的開放版本;Muse Spark仍維持閉源,規模較小的Glimmer則可被下載、微調並在使用者硬體上運行。
根據VentureBeat報導,Meta自測鎖定32GB硬體的K-Quant-Dynamic版本,在15項基準測試中平均準確度下降0.2%;鎖定24GB硬體的K-Quant-17GB版本下降1%。VentureBeat特別註明,這些數字為Meta自家測量,非獨立第三方評測。
根據TechCrunch報導,Anthropic宣布自2026年8月14日起,將自動模式設為Claude Code Pro、Max、Team帳號的預設權限模式;ITHome與Inside報導指出,研究顯示自動模式攔截89%有害操作,遠高於人工審查的13.6%。
根據自由時報、中央社與科技新報報導,輝達與阿波羅、貝萊德、黑石、布魯克菲爾德、高盛及KKR等6家華爾街機構簽署合作備忘錄,共同推出運算融資平台,目標為AI基礎建設籌集超過5000億美元第三方資金,但融資條件與時間表尚未公布。
根據科技新報與《Inside》報導,SK海力士董事會8月7日決議在龍仁Y2與清州M17晶圓廠合計投資約54兆韓圜(約380億美元),分別用於生產DRAM、HBM與NAND快閃記憶體,兩廠首座無塵室預計於2029年6月與2028年12月啟用。