半導體專題

AI 晶片 Scale-Up 互連戰局:NVLink、UALink 與 Ultra Ethernet 的頻寬對決

N
Nathan科技編輯 · 技術負責人
發布 · 更新
NVIDIA 第六代 NVLink 在 72-GPU domain 達 260 TB/s 機櫃級頻寬;開放陣營以 UALink(scale-up、支援 1,024 加速器)與 Ultra Ethernet(scale-out)分頭挑戰其封閉互連。

Scale-up 互連如何重新定義 AI 系統架構?

NVIDIA 將 AI GPU 叢集互連分成兩層,scale-up 讓同一 domain 內的 GPU 表現如單一運算引擎CITE:E1。NVIDIA 定義 scale-out 網路負責跨資料中心連接各伺服器,而 scale-up 網路則讓同一個 domain 內的 GPU 彼此協同運作、表現得像單一運算引擎CITE:E1。NVIDIA 進一步將 NVLink 定位為專為 AI factory 打造的 scale-up 網路CITE:E1

互連頻寬與延遲為何決定 AI 工廠效能上限?

NVIDIA 指出全對全(all-to-all)頻寬與延遲對 AI factory 效能至關重要CITE:E6。NVIDIA 說明,若 expert 位於低頻寬或高延遲的網路後方,expert parallelism 帶來的效能增益會被通訊開銷抵銷CITE:E6。這使互連規格不只是硬體參數,而是直接決定大規模平行運算能否兌現效能增益的關鍵變數CITE:E6

NVLink 的頻寬規格對標:從 GPU-to-GPU 的 3.6 TB/s 到機櫃級的 260 TB/s

NVIDIA 第六代 NVLink 為每顆 GPU 提供 3.6 TB/s 雙向 GPU-to-GPU 頻寬CITE:E2。在 72-GPU domain 規模下,NVLink 可達到 260 TB/s 的機櫃級頻寬CITE:E2。機櫃級實作上,GB200 NVL72 以液冷機櫃設計連結 36 顆 Grace CPU 與 72 顆 Blackwell GPUCITE:E3,其 NVLink Switch System 提供 130 TB/s 低延遲 GPU 通訊,用於 AI 與高效能運算(HPC)工作負載CITE:E3

標準 / 產品規格項目數值
NVLink 第六代GPU-to-GPU 雙向頻寬(每 GPU)3.6 TB/s
NVLink 第六代72-GPU domain 機櫃級頻寬260 TB/s
GB200 NVL72NVLink Switch System GPU 通訊頻寬130 TB/s
GB200 NVL72機櫃內處理器規模36 顆 Grace CPU + 72 顆 Blackwell GPU
UALink 200G 1.0每通道頻寬200G
UALink 200G 1.0單一 AI 運算 pod 最大加速器數1,024 個
UALink Consortium成員公司數85 家以上

UALink 標準:超過 85 家產業巨頭如何挑戰 NVIDIA 的互連壟斷?

UALink Consortium 定位 UALink 為新一代 AI 工作負載的開放 scale-up 互連標準CITE:E4。UALink 200G 1.0 規格以每通道 200G 頻寬,支援單一 AI 運算 pod 內最多 1,024 個加速器的 scale-up 連接CITE:E4。這項開放產業標準由超過 85 家成員公司共同定義,董事會成員包括 Alibaba、AMD、Apple、Astera Labs、AWS、Cisco、Google、HPE、Intel、Meta、Microsoft 與 SynopsysCITE:E7

Ultra Ethernet:以太網為基礎的 AI 互連替代方案

Ultra Ethernet Consortium 推動以 Ethernet 為基礎的開放通訊堆疊,鎖定 AI 與 HPC 大規模網路需求CITE:E5。Ultra Ethernet Consortium 的目標是打造開放、可互通、高效能的完整通訊堆疊架構,以應付 AI 與 HPC 持續成長的大規模網路需求CITE:E5。該組織明確把「AI at scale」界定為「GPU scale-out network」,對應 NVIDIA 定義中 scale-out 網路所涵蓋的跨伺服器連接範疇CITE:E1CITE:E5

這代表什麼:三方陣營呈現分層競爭態勢——NVIDIA 以 260 TB/s 機櫃級頻寬與 130 TB/s 的 NVLink Switch System 鞏固 scale-up 網路的效能上限CITE:E2CITE:E3;UALink 以 85 家以上成員公司組成的開放標準,鎖定同一個 scale-up 層級與 NVIDIA 競爭,並支援單一 pod 最多 1,024 個加速器CITE:E4CITE:E7;Ultra Ethernet Consortium 則把版圖劃向 scale-out 網路CITE:E5。而 NVIDIA 本身強調,全對全頻寬與延遲一旦跟不上,expert parallelism 的效能增益就會被通訊開銷抵銷CITE:E6——這正是三方陣營爭奪互連規格主導權的核心利害所在。

📊 證據與數據

常見問題

Scale-up 互連如何重新定義 AI 系統架構?

NVIDIA 將 AI GPU 叢集互連分成兩層,scale-up 讓同一 domain 內的 GPU 表現如單一運算引擎CITE:E1。

互連頻寬與延遲為何決定 AI 工廠效能上限?

NVIDIA 指出全對全(all-to-all)頻寬與延遲對 AI factory 效能至關重要CITE:E6。NVIDIA 說明,若 expert 位於低頻寬或高延遲的網路後方,expert parallelism 帶來的效能增益會被通訊開銷抵銷CITE:E6。

UALink 標準:超過 85 家產業巨頭如何挑戰 NVIDIA 的互連壟斷?

UALink Consortium 定位 UALink 為新一代 AI 工作負載的開放 scale-up 互連標準CITE:E4。UALink 200G 1.0 規格以每通道 200G 頻寬,支援單一 AI 運算 pod 內最多 1,024 個加速器的 scale-up 連接CITE:E4。

📎 資料來源

  1. developer.nvidia.com
  2. nvidia.com
  3. ualinkconsortium.org
  4. ultraethernet.org

延伸數據

作者觀點Nathan

NVLink 260 TB/s 的機櫃級頻寬與 UALink 支援 1,024 個加速器的規格顯示,scale-up 網路的競爭已從單顆晶片頻寬轉向機櫃級系統整合能力。UALink 由 85 家以上成員公司共同制定,董事會涵蓋 AMD、Google、Microsoft、AWS、Intel 等企業,反映開放陣營選擇以集體標準對抗單一廠商的機櫃級優勢,而非在單一規格數字上正面對標。接下來值得觀察的指標,是 UALink 200G 1.0 規格何時出現 1,024 加速器規模的實際商用部署案例,這將是開放標準能否從紙面規格走向機櫃級實戰的關鍵驗證點。

N
Nathan科技編輯 · 技術負責人

相關文章

專題

太陽能+儲能:人工智慧(AI)資料中心現在最務實的電力解方

太陽能發電成本十年間下降近九成,已低於天然氣,搭配均價每度115美元的鋰電池儲能後可延伸供電至夜間;2024年全球新增553GW太陽能,亞利桑那案場更已實際為Meta資料中心供電,但24小時基載仍需天然氣或核能等可調度電源補足。

Nathan ·