深度學習浮點精度格式對照:FP32 / TF32 / FP16 / BF16 / FP8
深度學習常用浮點格式的位元配置(符號/指數/尾數)與用途對照;指數位元決定動態範圍、尾數位元決定精度。
| 格式 | 總位元 | 符號位元 | 指數位元 | 尾數位元 | 說明 |
|---|---|---|---|---|---|
| FP32(單精度) | 32 | 1 | 8 | 23 | IEEE 754 標準,訓練精度基準 |
| TF32(NVIDIA) | 19 | 1 | 8 | 10 | Ampere+ Tensor Core;範圍同 FP32、精度近 FP16 |
| FP16(半精度) | 16 | 1 | 5 | 10 | IEEE 754;動態範圍窄,常需 loss scaling |
| BF16(bfloat16) | 16 | 1 | 8 | 7 | 動態範圍同 FP32、精度較低;訓練常用 |
| FP8 E4M3 | 8 | 1 | 4 | 3 | 精度較高,常用於前向/權重 |
| FP8 E5M2 | 8 | 1 | 5 | 2 | 動態範圍較大,常用於梯度 |
方法與來源
整理自 IEEE 754(FP32/FP16)、NVIDIA 混合精度文件(TF32)、Google bfloat16 說明,及 FP8(E4M3/E5M2)交換格式規格。位元數為格式定義值。
來源:https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/index.html
擷取日期:2026-09-05
常見問題
- 「深度學習浮點精度格式對照:FP32 / TF32 / FP16 / BF16 / FP8」涵蓋哪些對象?
- 本表涵蓋 FP32(單精度)、TF32(NVIDIA)、FP16(半精度)、BF16(bfloat16)、FP8 E4M3、FP8 E5M2,對照欄位包含:格式、總位元、符號位元、指數位元、尾數位元、說明。
- 這張表的資料來源與方法為何?
- 整理自 IEEE 754(FP32/FP16)、NVIDIA 混合精度文件(TF32)、Google bfloat16 說明,及 FP8(E4M3/E5M2)交換格式規格。
- 資料最後更新於何時?
- 本表資料擷取/更新日為 2026-09-05。