非 NVIDIA 的 AI 推理晶片/ASIC 對照(2026 年 8 月)
Groq、Cerebras、SambaNova、AWS Trainium/Inferentia、Google TPU、Intel Gaudi——NVIDIA 之外的 AI 加速晶片戰場。以架構、記憶體型態(大 SRAM vs HBM)、部署方式對照,凸顯「確定性 dataflow」「晶圓級單晶片」等差異化路線。
| 廠商 / 晶片 | 架構特色 | 工作負載 | 記憶體 | 部署 | 效能(廠商宣稱) |
|---|---|---|---|---|---|
| Groq LPU | 確定性 dataflow,權重全放 SRAM,超低延遲 | 推理專用 | 500MB SRAM/顆(無 HBM) | 雲端/API(GroqCloud) | 1,000 tokens/s/user(機架) |
| Cerebras WSE-3 | 晶圓級單晶片,90 萬 AI 核 | 訓練+推理 | 44GB 片上 SRAM(無 HBM) | 可買(CS-3)+ 雲 | Llama4 400B 推理 2,500 tok/s/user |
| SambaNova SN40L | 可重構 RDU,三層記憶體 | 兩用(主打推理) | 520MB SRAM + 64GB HBM + 1.5TB DDR | 可買 + 雲/API | Llama 405B 129 tok/s、8B 1,042 tok/s |
| AWS Trainium2 | 自研 systolic ASIC,NeuronLink | 訓練+推理 | 96GB HBM3e/顆(~2.9TB/s) | 僅 AWS 雲 | 667 dense BF16 TFLOP/s/顆 |
| AWS Inferentia2 | 推理專用 ASIC(NeuronCore-v2) | 推理專用 | 32GB HBM/顆 | 僅 AWS 雲 | 最高 190 TFLOPS FP16/顆 |
| Google TPU v7 Ironwood | 脈動陣列,為推理時代設計 | 推理為主(亦訓練) | 192GB HBM3e/顆(7.37TB/s) | 僅 Google Cloud | 4,614 TFLOPS/顆;pod 42.5 ExaFLOPS |
| Intel Gaudi 3 | 雙 die + on-die 24×200GbE 乙太 | 訓練+推理 | 128GB HBM2e(3.7TB/s)+ 96MB SRAM | 可買 + 雲 | 1.8 PFLOPS FP8/BF16;900W |
| AMD MI355X(對照) | CDNA4 通用 GPU(非推理 ASIC) | 兩用(主打推理) | 288GB HBM3e(8TB/s) | 可買 + 雲 | 10 PFLOPS FP4/FP6 |
方法與來源
各晶片架構/記憶體/部署取自各廠官網或技術白皮書(2026-08),擷取日 2026-08-26。**效能欄全為「廠商宣稱」**(tokens/s、PFLOPS 皆為各廠自報,非獨立第三方 benchmark;唯 AMD MI355X 的 MLPerf 為公開榜但仍由 AMD 提交)。**分類**:純推理=Groq、Inferentia2;兩用主打推理=SambaNova、TPU Ironwood、MI355X;兩用=Cerebras、Trainium2、Gaudi 3。**記憶體特色**:大 SRAM 無 HBM=Groq(500MB/顆)、Cerebras(44GB 片上);SambaNova 為 SRAM+HBM+DDR 三層;其餘以 HBM 為主。**待註**:2026-08 搜尋反覆出現「NVIDIA Groq 3 LPX」命名,來源真偽 uncertain,Groq 最新世代具體數字信心下修;Cerebras 規格經技術媒體轉載官方數字。AMD MI355X 嚴格為通用 GPU 非推理專用 ASIC,列入僅供對照。一手來源:Google TPU https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/ironwood-tpu-age-of-inference/ ;AWS Trainium2 https://aws.amazon.com/ec2/instance-types/trn2/ ;SambaNova https://sambanova.ai/blog/sn40l-chip-best-inference-solution ;Intel Gaudi3 白皮書 https://cdrdv2-public.intel.com/817486/gaudi-3-ai-accelerator-white-paper.pdf ;Groq https://groq.com/lpu-architecture 。
擷取日期:2026-08-26
常見問題
- 「非 NVIDIA 的 AI 推理晶片/ASIC 對照(2026 年 8 月)」涵蓋哪些對象?
- 本表涵蓋 Groq LPU、Cerebras WSE-3、SambaNova SN40L、AWS Trainium2、AWS Inferentia2、Google TPU v7 Ironwood、Intel Gaudi 3、AMD MI355X(對照),對照欄位包含:廠商 / 晶片、架構特色、工作負載、記憶體、部署、效能(廠商宣稱)。
- 這張表的資料來源與方法為何?
- 各晶片架構/記憶體/部署取自各廠官網或技術白皮書(2026-08),擷取日 2026-08-26。
- 資料最後更新於何時?
- 本表資料擷取/更新日為 2026-08-26。