半導體快訊

NVIDIA攜開源社群發布多款AI模型與代理工具,NeMo Switchyard推理成本降至Opus 4.8三分之一

N
Nathan科技編輯 · 技術負責人
發布 · 更新
根據NVIDIA部落格報導,NVIDIA在2026年8月11日發布Nemotron 3.5 Lightning等開放模型,並整合MiniMax、DeepSeek、Meta等社群開放權重模型,同時揭露NeMo Switchyard可將推理成本降至Opus 4.8單獨使用時的約三分之一。

開放源社群如何推動多樣化 AI 模型的創新?

根據 NVIDIA 部落格報導,NVIDIA 自身與多家開源社群夥伴在 2026 年 8 月 11 日同步發布一系列開放權重模型,涵蓋機器人視覺、影片生成、程式碼代理與長文本推理等不同用途。

NVIDIA 表示,其新款 Cosmos 3 Edge 是一款 40 億參數(4-billion-parameter)的開放世界模型,鎖定機器人、自駕車與視覺 AI 應用,體積僅為 Cosmos 3 Nano 的四分之一,可在 NVIDIA DGX Spark 與 NVIDIA Jetson 裝置上直接運行(E1)。

同一篇報導提到,MiniMax-H3 是一款 330 億參數的開放權重模型,能從文字、圖片、影片、音訊或四者混合輸入生成影片與同步立體聲音訊(E2)。深度求索(DeepSeek)則更新了 DeepSeek-V4-Flash,這是一款 2840 億參數的混合專家(MoE)模型,具備 130 億活躍參數與 100 萬 token 的上下文窗口,開發者可透過社群建置的 GGUF 版本,在 NVIDIA DGX Station 上本地運行(E4)。

Thinking Machines Lab 推出的 Inkling-Small 屬於前沿級多模態開放權重模型,總參數達 2760 億,但每個 token 僅啟動 120 億參數;該模型在 NVIDIA GB300 NVL72 上完成訓練,可在單台 DGX Station 或兩台 DGX Spark 系統上運行(E5)。Meta 同日發布 Muse Glimmer,一款 300 億參數的密集型(dense)開放權重模型,上下文窗口超過 12 萬 token,專為程式碼撰寫與本地代理式 AI 設計(E9)。此外,NVIDIA 也擴充了 Nemotron 3 模型家族,推出開放的 300 億參數混合專家模型 Nemotron 3.5 Lightning,鎖定全天候運作的代理應用(E13)。

模型參數規模關鍵特色證據
Cosmos 3 Edge40 億機器人/自駕車視覺 AI,體積為 Cosmos 3 Nano 的四分之一E1
MiniMax-H3330 億生成影片+同步立體聲音訊E2
DeepSeek-V4-Flash2840 億(130 億活躍)100 萬 token 上下文窗口E4
Inkling-Small2760 億(120 億活躍/token)前沿級多模態、可調整思考程度E5
Muse Glimmer300 億12 萬+ token 上下文,聚焦程式碼與代理E9
Nemotron 3.5 Lightning300 億(MoE)可客製化,鎖定全天候代理E13

NVIDIA GPU 在高效推理中的性能優勢為何?

NVIDIA 部落格同時公布多項模型在自家 GPU 上的效能數據。阿里巴巴發布的 Wan-Animate-2 是一款 140 億參數的開放權重模型,可將驅動影片中的動作與臉部表情轉移到靜態角色圖像上;報導指出,該模型在 NVIDIA RTX PRO 5000 Blackwell(48GB)上生成速度最高提升 16 倍,在 NVIDIA RTX 5090 上相較 Apple M3 Ultra 最高快 26 倍(E7)。

另一款影片生成模型 LTX-2.5 針對 NVIDIA RTX GPU、DGX Spark 與 DGX Station 系統做了最佳化;在 NVIDIA RTX 6000 PRO GPU 上,效能最高提升 20%,記憶體用量減少 40%(E8)。而 Meta 的 Muse Glimmer 在 NVIDIA RTX 5090 上,每秒可處理超過 200 個 token,NVIDIA 表示這讓全天候運作的代理能在單一系統上就地處理資料並完成多步驟複雜任務(E10)。

模型對照 GPU/裝置效能提升證據
Wan-Animate-2RTX PRO 5000 Blackwell(48GB)最高快 16 倍E7
Wan-Animate-2RTX 5090(對比 Apple M3 Ultra)最高快 26 倍E7
LTX-2.5RTX 6000 PRO效能提升 20%、記憶體省 40%E8
Muse GlimmerRTX 5090每秒逾 200 tokenE10

本地訓練與執行工具如何民主化 AI 開發?

NVIDIA 部落格報導指出,開放模型能否真正落地,也取決於本地訓練與執行工具是否到位。前述 Cosmos 3 Edge 即是一例:這款 40 億參數模型設計為可直接在 NVIDIA DGX Spark 與 NVIDIA Jetson 裝置上運行,無需依賴雲端伺服器(E1)。

工具面上,Unsloth 即將在下週一推出 Unsloth Desktop。根據報導,這款產品把本地模型推理、圖片與影片擴散生成、微調(fine-tuning)、代理整合、網路查找與程式碼執行整合進單一全開源桌面應用程式;NVIDIA 部落格的發布資料將其定位為「首個能同時在本地訓練與運行 AI 模型的桌面應用程式」(E6)。

新一代代理模型如何提升自主任務執行能力?

代理式(agentic)模型是本次發布的另一重點。Poolside AI 推出的 Laguna S 2.1 是一款 1180 億參數的開放權重代理式程式碼模型,可持續執行長達數小時的任務;報導指出,其 NVFP4 checkpoint 讓開發者能在單台 NVIDIA DGX Spark 上以較低的運算與記憶體需求運行,且不犧牲準確度(E3)。

NVIDIA 自身推出的 Nemotron 3.5 Lightning 同樣鎖定全天候代理場景,是一款可客製化的開放 300 億參數混合專家模型(E13)。NVIDIA 表示,相較同級開放模型,Nemotron 3.5 Lightning 的 token 生成速度最高快 4 倍,任務完成時間快 30%(E14)。

多模型系統路由如何優化推理成本與性能?

除了單一模型的效能提升,NVIDIA 也公布了跨模型路由技術的內部測試結果。根據 NVIDIA 部落格,其 NeMo Switchyard 透過在每個步驟中跨多個模型系統路由任務,在內部基準測試中維持了前沿級的任務完成度,同時將基準完成成本降至僅約為單獨使用 Opus 4.8 的三分之一(E15)。

企業 AI 基礎設施的自動化部署進展如何?

在基礎設施層面,NVIDIA Sync 新增的 Cluster Assistant 功能可自動化設定兩台或以上的 NVIDIA DGX Spark 系統組成高速叢集;開發者只需透過 NVIDIA ConnectX-7 連接埠連接系統,NVIDIA Sync 便會自動配置網路、跨節點分配工作負載並監控系統健康狀態(E11)。

另外,NVIDIA DGX Spark 也將新增原生 ARM64 Linux 版 Google Chrome,使用者可直接從 DGX Dashboard 單擊安裝(E12)。

這代表什麼?

從 NVIDIA 部落格一次公布的內容看,本次發布同時涵蓋模型規模的兩端:一端是 Cosmos 3 Edge(40 億參數)與 Muse Glimmer(300 億參數)這類可在單一裝置上運行的輕量模型,另一端則是 DeepSeek-V4-Flash(2840 億參數)與 Inkling-Small(2760 億參數)這類需要 DGX Station 等級硬體的前沿模型;兩者共通點是都強調「本地可執行」,分別對應 DGX Spark、DGX Station 等不同層級的硬體。效能數據上,Wan-Animate-2 在 RTX 5090 對比 Apple M3 Ultra 快達 26 倍、Nemotron 3.5 Lightning 較同級模型快 4 倍,顯示多項比較都以 NVIDIA 自家 GPU 或系統為基準;而 NeMo Switchyard 把推理成本壓低到 Opus 4.8 的三分之一,則點出跨模型路由與單一大模型之間存在成本落差,是本次發布中唯一直接觸及推理經濟性的數據。

📊 證據與數據

📎 資料來源

  1. blogs.nvidia.com
N
Nathan科技編輯 · 技術負責人

相關文章

快訊

台積電董事會核准Q2配息維持7元 首度開放外資美元股利選擇

根據《經濟日報》與鉅亨網報導,台積電董事會8月11日核准2026年第2季每股現金股利維持7元,並首度開放外資股東選擇以美元收取股利;同時通過294億4,250萬美元資本預算,並核准與索尼半導體合資規模不超過2,820億日圓的新公司。

林紀旭 James Lin ·
快訊

Google AI摘要衝擊流量 法國逾300家媒體聯盟APIG提出申訴

根據TechNews與中央社報導,代表逾300家法國媒體的APIG聯盟於2026年8月11日向當局申訴,指Google今年7月上線的AI摘要功能未經談判即成既成事實;法國報業目前7成流量依賴Google,業界估計衝擊恐達3成。

EffectStory 編輯部 ·