AI專題

NeRF論文如何用5D函數合成新視角?Instant-NGP如何把訓練壓縮到數秒?

林紀旭 James Lin總編輯
發布 · 更新
NeRF論文以全連接深度網路將場景表示為連續5D函數,沿相機光線以體積渲染合成新視角,在複雜場景達到當時最先進效果。NVIDIA的Instant-NGP以多解析度雜湊編碼與全融合CUDA核心取得數個數量級加速,訓練縮至數秒,1920×1080解析度下數十毫秒完成渲染,前30秒即獲多數視覺品質。

NeRF 如何用多層感知器表示連續的 5D 場景函數?

NeRF論文以全連接、非卷積的深度網路表示場景,輸入為單一連續的5D座標CITE:E1。這個5D座標由空間位置x、y、z與觀看方向θ、φ組成,網路輸出則是該空間位置的體積密度,以及會隨觀看方向變化的發射輻射CITE:E1

NeRF 如何透過體積渲染從稀疏視角合成新視角?

NeRF沿著相機光線查詢一系列5D座標,並以經典的體積渲染技術,把網路輸出的顏色與密度投影成一張影像CITE:E2。這代表新視角的產生不依賴額外的深度感測器,而是把整條光線上取樣到的密度與顏色累積、投影,合成出對應視角的畫面CITE:E2

NeRF 在新視角合成上達到什麼樣的效果?

NeRF在複雜場景的新視角合成上,達到當時最先進效果CITE:E3。NeRF專案頁指出,這套方法以稀疏的一組輸入視角,最佳化底層的連續體積場景函數,即可達成上述效果CITE:E3。「稀疏輸入視角」意味著不需要密集拍攝場景的每個角度,系統仍能重建出連續的場景表示,並生成訓練時未曾出現過的新視角畫面。

Instant-NGP 採用了什麼加速技術架構?

Instant-NGP由NVIDIA研究團隊提出,採用多解析度雜湊編碼與全融合CUDA核心兩項技術CITE:E4。論文作者Müller等人指出,多解析度雜湊編碼負責把輸入座標映射到可學習的特徵向量,全融合CUDA核心則把相關運算整合進單一CUDA核心執行,兩者合力構成Instant-NGP的加速架構CITE:E4

Instant-NGP 的訓練和渲染性能提升有多大?

Instant-NGP取得數個數量級的整體加速,使高品質神經圖形基元的訓練縮短到數秒CITE:E4。同一篇論文並指出,系統能以數十毫秒完成1920×1080解析度的渲染CITE:E4。NVIDIA開發者部落格進一步說明,以Instant NeRF訓練場景時,大部分視覺品質會在最初30秒內就取得,之後數分鐘內仍會持續改善CITE:E5

指標數值
整體加速幅度數個數量級CITE:E4
訓練時間縮短至數秒CITE:E4
渲染速度1920×1080解析度下數十毫秒CITE:E4
多數視覺品質達成時間最初30秒內CITE:E5
持續改善時間之後數分鐘內CITE:E5

這代表什麼:NeRF論文與NeRF專案頁共同確立的,是以全連接深度網路把場景表示成連續5D函數、再用體積渲染合成新視角的技術路徑,並在複雜場景的新視角合成上取得當時最先進效果CITE:E1CITE:E3。Instant-NGP延續同一套「5D座標查詢加體積渲染」邏輯,把工程重心放在編碼與運算層——多解析度雜湊編碼與全融合CUDA核心,取得數個數量級的整體加速,將訓練壓縮到數秒、渲染壓縮到1920×1080解析度下的數十毫秒CITE:E4。NVIDIA官方部落格提供的30秒與數分鐘時間點,進一步說明這種加速在實際使用情境下的具體樣貌CITE:E5

📊 證據與數據

常見問題

NeRF 如何用多層感知器表示連續的 5D 場景函數?

NeRF論文以全連接、非卷積的深度網路表示場景,輸入為單一連續的5D座標CITE:E1。這個5D座標由空間位置x、y、z與觀看方向θ、φ組成,網路輸出則是該空間位置的體積密度,以及會隨觀看方向變化的發射輻射CITE:E1。

NeRF 如何透過體積渲染從稀疏視角合成新視角?

NeRF沿著相機光線查詢一系列5D座標,並以經典的體積渲染技術,把網路輸出的顏色與密度投影成一張影像CITE:E2。這代表新視角的產生不依賴額外的深度感測器,而是把整條光線上取樣到的密度與顏色累積、投影,合成出對應視角的畫面CITE:E2。

NeRF 在新視角合成上達到什麼樣的效果?

NeRF在複雜場景的新視角合成上,達到當時最先進效果CITE:E3。NeRF專案頁指出,這套方法以稀疏的一組輸入視角,最佳化底層的連續體積場景函數,即可達成上述效果CITE:E3。「稀疏輸入視角」意味著不需要密集拍攝場景的每個角度,系統仍能重建出連續的場景表示,並生成訓練時未曾出現過的新視角畫面。

Instant-NGP 採用了什麼加速技術架構?

Instant-NGP由NVIDIA研究團隊提出,採用多解析度雜湊編碼與全融合CUDA核心兩項技術CITE:E4。論文作者Müller等人指出,多解析度雜湊編碼負責把輸入座標映射到可學習的特徵向量,全融合CUDA核心則把相關運算整合進單一CUDA核心執行,兩者合力構成Instant-NGP的加速架構CITE:E4。

📎 資料來源

  1. arxiv.org
  2. matthewtancik.com
  3. arxiv.org
  4. developer.nvidia.com

延伸數據

作者觀點林紀旭 James Lin

NeRF論文與專案頁確立的,是用全連接深度網路把5D座標映射成密度與輻射、再以體積渲染合成新視角的架構,而非仰賴顯式三維網格。Instant-NGP顯示這套架構的效能瓶頸主要在編碼與運算層:多解析度雜湊編碼搭配全融合CUDA核心,就把訓練壓到數秒、渲染壓到1920×1080解析度下數十毫秒。接下來值得觀察的具體指標,是NVIDIA提到的『前30秒取得多數視覺品質』這個門檻能否再被壓低。

林紀旭 James Lin總編輯

相關文章

快訊

Google宣布在芬蘭投資130億歐元建置AI基礎設施

Google宣布2027至2028年將在芬蘭投資130億歐元(151億美元)建置AI基礎設施,為其歐洲最大單一投資案,涵蓋三處新建與一處擴建資料中心,並與Fortum簽署22年購電協議取得核電機組50%發電量。

EffectStory 編輯部 ·