AI專題

擴散模型如何從隨機雜訊生成影像?加噪與去噪的完整原理

N
Nathan科技編輯 · 技術負責人
發布 · 更新
擴散模型透過前向過程逐步加入高斯雜訊、反向過程學習去噪來生成影像;DDPM 在 CIFAR10 資料集取得 Inception 分數 9.46、FID 分數 3.17,此機制也是 Stable Diffusion 等文字生成影像工具的基礎。

什麼是擴散模型?基本原理如何?

擴散模型是一種受非平衡熱力學啟發的潛在變數模型,能生成高品質影像CITE:E1。這篇由 Ho 等人於 2020 年 6 月 19 日發表於 arXiv 的論文指出,擴散機率模型(diffusion probabilistic models)這類潛在變數模型,可呈現高品質的影像合成結果CITE:E1。NVIDIA 在 2023 年 12 月 14 日的技術部落格說明,理解擴散模型可以先從較容易的方向著手,也就是透過逐步對影像加入雜訊來破壞影像CITE:E7

前向過程如何逐步加噪破壞影像?

前向過程在每個時間步對影像加入少量高斯雜訊,再重新縮放以維持影像尺寸不變CITE:E3。IBM 說明,在每個時間步 t,系統會對前一張影像 xt-1 加入少量高斯雜訊,接著重新縮放影像以維持固定的影像尺寸CITE:E3。NVIDIA 則指出,這個逐步加入雜訊、破壞影像的方向,是理解擴散模型運作機制的起點CITE:E7

反向過程如何透過去噪學習生成影像?

模型透過學習反轉前向過程的加噪步驟,本質上是在學習把純高斯雜訊去噪成一張乾淨影像CITE:E4。IBM 說明,模型在學習反轉前向加噪步驟的過程中,實際上是在學習如何將純高斯雜訊去噪為一張乾淨影像CITE:E4。IBM 並進一步說明,擴散模型在每個影像步驟被訓練來預測「整體加入的雜訊」,而不是該步驟要移除的特定雜訊量CITE:E5

DDPM 在 CIFAR10 資料集上達成的性能指標為何?

DDPM 在無條件 CIFAR10 資料集取得 Inception 分數 9.46、FID 分數 3.17CITE:E2。Ho 等人在論文中指出,在無條件 CIFAR10 資料集上,DDPM 取得 Inception 分數 9.46,以及當時最佳(state-of-the-art)的 FID 分數 3.17CITE:E2

指標數值資料集備註
Inception 分數9.46CIFAR10(無條件)Ho 等人論文報告數值
FID 分數3.17CIFAR10(無條件)論文發表當時最佳(state-of-the-art)

Stable Diffusion 等擴散模型在實際應用中如何使用?

Stable Diffusion 是一種生成式 AI(Generative AI)模型,能從文字與影像提示生成獨特的擬真影像CITE:E6。AWS 說明,Stable Diffusion 屬於生成式人工智慧模型,可根據文字與影像提示,產生獨特且擬真的影像CITE:E6

這代表什麼:Ho 等人於 2020 年 6 月發表的 DDPM 論文,以 Inception 分數 9.46、FID 分數 3.17 的量化結果證明「加噪—去噪」機制可產生高品質影像CITE:E1CITE:E2;IBM 進一步拆解這套機制的兩個階段——前向過程逐步加入高斯雜訊CITE:E3、反向過程學習去噪重建影像CITE:E4CITE:E5;NVIDIA 在 2023 年 12 月的說明則呼應同一套「先破壞、再還原」的理解路徑CITE:E7;而 AWS 所述的 Stable Diffusion,顯示同一套去噪機制已從學術驗證階段,發展為可從文字提示生成擬真影像的實際工具CITE:E6。從 2020 年的論文指標到 2023 年的技術說明,再到文字生成影像的應用,證據呈現的是同一套加噪去噪原理的延續,而非彼此獨立的技術路線。

📊 證據與數據

常見問題

什麼是擴散模型?基本原理如何?

擴散模型是一種受非平衡熱力學啟發的潛在變數模型,能生成高品質影像CITE:E1。這篇由 Ho 等人於 2020 年 6 月 19 日發表於 arXiv 的論文指出,擴散機率模型(diffusion probabilistic models)這類潛在變數模型,可呈現高品質的影像合成結果CITE:E1。

前向過程如何逐步加噪破壞影像?

前向過程在每個時間步對影像加入少量高斯雜訊,再重新縮放以維持影像尺寸不變CITE:E3。IBM 說明,在每個時間步 t,系統會對前一張影像 xt-1 加入少量高斯雜訊,接著重新縮放影像以維持固定的影像尺寸CITE:E3。NVIDIA 則指出,這個逐步加入雜訊、破壞影像的方向,是理解擴散模型運作機制的起點CITE:E7。

反向過程如何透過去噪學習生成影像?

模型透過學習反轉前向過程的加噪步驟,本質上是在學習把純高斯雜訊去噪成一張乾淨影像CITE:E4。IBM 說明,模型在學習反轉前向加噪步驟的過程中,實際上是在學習如何將純高斯雜訊去噪為一張乾淨影像CITE:E4。

DDPM 在 CIFAR10 資料集上達成的性能指標為何?

DDPM 在無條件 CIFAR10 資料集取得 Inception 分數 9.46、FID 分數 3.17CITE:E2。Ho 等人在論文中指出,在無條件 CIFAR10 資料集上,DDPM 取得 Inception 分數 9.46,以及當時最佳(state-of-the-art)的 FID 分數 3.

📎 資料來源

  1. arxiv.org
  2. ibm.com
  3. aws.amazon.com
  4. developer.nvidia.com
作者觀點Nathan

DDPM 論文把「加噪可逆、去噪可學習」這個概念,轉化成 FID 3.17、Inception 9.46 這類可驗證的量化指標,這是擴散模型從純粹概念走向工程可比較階段的關鍵一步。AWS 說明的 Stable Diffusion 顯示,同一套去噪機制已包裝成從文字提示直接產生擬真影像的產品層應用,顯示技術路徑從論文指標走向終端工具具有延續性。接下來值得觀察的指標,是後續擴散模型是否持續公布 FID、Inception 分數等同一套量化基準,讓不同模型的生成品質能被直接比較。

N
Nathan科技編輯 · 技術負責人

相關文章

快訊

輝達投資聯發科35億美元 深化AI晶片與車用合作

輝達以35億美元認購聯發科39億美元海外可轉換公司債,成為輝達首次大手筆投資台灣公司;雙方將在AI基礎建設、邊緣AI運算與車用平台三大領域深化合作,並導入NVLink Fusion與NVHBM技術銜接資料中心晶片。

EffectStory 編輯部 ·