半導體快訊

NVIDIA 公布 Vera Rubin 平台後訓練成本效益數據,Nemotron 3 Ultra 展示 5500 億參數規模

N
Nathan科技編輯 · 技術負責人
發布 · 更新
根據 NVIDIA 部落格宣布,Vera Rubin 平台可用四分之一 GPU 訓練同規模最大模型,Vera CPU 吞吐量較同業提升 30%;NVIDIA 同時發表 5500 億參數的 Nemotron 3 Ultra,SWE-bench 得分達 71.7%。

輝達(NVIDIA)於官方部落格發布文章,說明新一代運算平台 Vera Rubin 如何針對「後訓練(post-training)」工作負載——即強化學習(RL)、監督式微調等模型訓練後段流程——提升每美元可獲得的智能產出。NVIDIA 在文章中一併揭露開放權重模型 Nemotron 3 Ultra 的規格與基準測試成績,並引述 Prime Intellect、Perplexity、Together AI 等客戶的測試與部署經驗。

關鍵數字一覽

指標數值說明出處
GPU 用量對比 Blackwell 世代四分之一訓練相同規模最大模型所需 GPU 數量NVIDIA 部落格
Vera CPU 吞吐量提升30%Prime Intellect 測試,對比其他 x86 架構NVIDIA 部落格引述 Prime Intellect
Nemotron 3 Ultra 參數量5500 億開放權重混合專家(MoE)模型NVIDIA 部落格
SWE-bench verified 得分71.7%真實世界程式碼基準測試NVIDIA 部落格
RDMA 權重同步時間少於 2 秒Perplexity RL 後訓練架構,兆參數模型同步NVIDIA 部落格引述 Perplexity
示意性 rollout token 估算200 億依前代 Nemotron 3 Super 數據按比例放大NVIDIA 部落格

Vera Rubin 平台如何在硬體層面壓低後訓練成本?

根據 NVIDIA 部落格文章,Vera Rubin 平台可用四分之一的 GPU 數量,訓練出與 Blackwell 世代相同規模的最大模型。文章並引述 Prime Intellect 的測試結果指出,在比較真實強化學習(RL)沙箱工作負載時,Vera CPU 相較於其他 x86 架構,平均每顆 CPU 的吞吐量高出 30%。這兩項數字分別對應硬體採購端(GPU 數量)與運算效率端(CPU 吞吐量)的成本結構。

NVIDIA Nemotron 3 Ultra 的規模與性能指標為何?

NVIDIA 在同一篇部落格中發表 Nemotron 3 Ultra,定位為開放權重、5500 億參數的混合專家(MoE)模型,並表示已提供可驗證的基準測試成績,以及完整揭露、於 NeMo RL 上執行的後訓練流程。NVIDIA 表示,該模型在真實世界程式碼基準測試 SWE-bench verified 上得分 71.7%,即在開源專案的真實軟體錯誤修復測試中,約每 10 個案例有 7 個能產出通過該專案自身測試的修正。

後訓練工作負載的技術與規模量化為何?

NVIDIA 部落格引述 Perplexity 的說法指出,其 RL 後訓練架構透過基於 RDMA 的權重傳輸引擎,能在少於兩秒的時間內,於訓練與推論運算節點之間同步兆參數規模的模型。文章同時提供一項示意性估算:以前一代 Nemotron 3 Super 約 120 萬次 rollout、每次約 1 萬個 token 為基礎,按比例放大至 Ultra 模型規模後,估算後訓練約需 200 億個 rollout token;NVIDIA 在文中明確標註此為示意性數字,而非實測結果。

對照項目數值
前代 Nemotron 3 Super rollout 次數約 120 萬次
每次 rollout 的 token 數約 1 萬個
放大至 Ultra 規模的示意性估算200 億個 rollout token

Vera Rubin 平台的部署案例與產業採納情況為何?

NVIDIA 部落格指出,Perplexity 後訓練完成的 Qwen3 235B 模型,目前部署於 NVIDIA GB200 NVL72 系統上提供服務。此外,NVIDIA 表示 Together AI 提供「後訓練即服務」,涵蓋監督式微調、強化學習與直接偏好優化,目前已在 NVIDIA 平台與優化核心函式庫上運作,並計畫下一步採用 Vera Rubin 平台。

這代表什麼

根據以上內容,NVIDIA 這篇部落格文章同時揭露硬體端與模型端的數據:硬體端呈現 Vera Rubin 平台在 GPU 用量與 CPU 吞吐量上的效率數字,模型端則以 Nemotron 3 Ultra 的參數規模與 SWE-bench 分數呈現能力,並搭配 Perplexity 的 RDMA 同步技術、GB200 NVL72 部署案例,以及 Together AI 的服務規劃,構成一則涵蓋硬體、模型與客戶採用的完整敘事。值得留意的是,文章中僅有 Prime Intellect 的 30% 吞吐量提升屬於第三方測試結果,而 200 億 rollout token 這項數字,NVIDIA 本身已標註為「示意性」估算,並非實測數據,兩者在證據強度上有所區別。

📊 證據與數據

常見問題

NVIDIA Nemotron 3 Ultra 是什麼樣的模型?

根據 NVIDIA 部落格,Nemotron 3 Ultra 是開放權重、5500 億參數的混合專家(MoE)模型,並提供可驗證的基準測試成績與完整揭露的後訓練流程。

Vera Rubin 平台在訓練最大模型時能省下多少 GPU?

NVIDIA 表示,Vera Rubin 平台可用四分之一的 GPU 數量,訓練出與 Blackwell 世代相同規模的最大模型。

📎 資料來源

  1. blogs.nvidia.com
N
Nathan科技編輯 · 技術負責人

相關文章