深度學習浮點精度格式對照:FP32 / TF32 / FP16 / BF16 / FP8

深度學習常用浮點格式的位元配置(符號/指數/尾數)與用途對照;指數位元決定動態範圍、尾數位元決定精度。

格式總位元符號位元指數位元尾數位元說明
FP32(單精度)321823IEEE 754 標準,訓練精度基準
TF32(NVIDIA)191810Ampere+ Tensor Core;範圍同 FP32、精度近 FP16
FP16(半精度)161510IEEE 754;動態範圍窄,常需 loss scaling
BF16(bfloat16)16187動態範圍同 FP32、精度較低;訓練常用
FP8 E4M38143精度較高,常用於前向/權重
FP8 E5M28152動態範圍較大,常用於梯度

方法與來源

整理自 IEEE 754(FP32/FP16)、NVIDIA 混合精度文件(TF32)、Google bfloat16 說明,及 FP8(E4M3/E5M2)交換格式規格。位元數為格式定義值。

來源:https://docs.nvidia.com/deeplearning/performance/mixed-precision-training/index.html

擷取日期:2026-09-05

常見問題

「深度學習浮點精度格式對照:FP32 / TF32 / FP16 / BF16 / FP8」涵蓋哪些對象?
本表涵蓋 FP32(單精度)、TF32(NVIDIA)、FP16(半精度)、BF16(bfloat16)、FP8 E4M3、FP8 E5M2,對照欄位包含:格式、總位元、符號位元、指數位元、尾數位元、說明。
這張表的資料來源與方法為何?
整理自 IEEE 754(FP32/FP16)、NVIDIA 混合精度文件(TF32)、Google bfloat16 說明,及 FP8(E4M3/E5M2)交換格式規格。
資料最後更新於何時?
本表資料擷取/更新日為 2026-09-05。