以液態神經網路與 CfC 連續時間變形場強化 3D Gaussian Splatting 動態場景重建
本研究針對單鏡頭動態3D重建,提出以液態神經網路(LNN)實作的連續時間變形場,取代傳統逐格MLP。透過Closed-form Continuous-time(CfC)單元加入時間門控,使變形隨時間平滑且無需數值求解。實驗在八個合成與七個實景資料上,精度與效能均超過原基線,在高頻關節運動上提升顯著。
研究背景與動機
從單鏡頭影片重建動態 3D 場景(4D 重建)是電腦視覺與圖形學的核心挑戰,應用範圍涵蓋擴增實境、遠距呈現與數位孿生。隨著可微分渲染與 Neural Radiance Field(NeRF)技術的成熟,D‑NeRF 等方法證明座標式 MLP 能以少量單目視角復原動態物體。
然而傳統的 Deformable 3D Gaussian Splatting(D‑3DGS)仍使用一個以時間位置編碼 γ(t) 為輸入的 MLP 產生每幀的變形偏移,缺乏時間相鄰幀之間的耦合,導致平滑性只能在優化過程中偶然出現。
液態神經網路(LNN)與 CfC 單元的設計
研究者把變形場替換為一疊 Closed‑form Continuous‑time(CfC)細胞,這是一種液態時間常數 ODE 的閉式解。每個 CfC 細胞在前向傳播時會計算一個 sigmoid 時間門控:
σ_τ = σ(W_a·z·t + W_b·z)門控在兩個候選隱藏狀態之間平滑插值,讓時間 t 的微小變化直接在損失面上產生結構化回應,無需額外的數值求解器。
實驗設置與結果
在八個 D‑NeRF 合成場景(如 Hell Warrior、T‑Rex)與七個 NeRF‑DS 真實場景(如 Sieve、Cup)上,液態變形場的表現與原 MLP 基線相當,且在高頻關節運動的場景中取得明顯提升。參數與 MAC(乘加運算)開銷與原基線持平,證明 CfC 能以極低成本提供連續時間先驗。
跨領域對比與未來展望
相較於 ODE‑GS、SDE‑based 方法,CfC 省去內部求解器的迭代計算,屬於成本最低的連續時間方案;而傳統 MLP 雖然在推論上同樣為前向傳播,但缺乏時間耦合的結構化平滑。未來若將 CfC 與圖神經網路、或是大型語言模型的時間感知模組結合,可能進一步提升多模態動態場景的即時渲染與控制。
此外,液態神經網路的時間門控概念可延伸至其他需要連續時間建模的領域,如機器人控制、流體模擬與時序資料預測,為降低數值求解成本提供新思路。
延伸閱讀
- 以 Transformer 與稀疏自編碼器從加密網路流量重建長期行為表徵
- NAKUL:結合動態核、可學習頻帶與圖導向注意力的狀態空間模型
- TimeTok:以層次化 Token 化與 Conditional Flow Matching 實現粒度可控的時間序列生成
代理人點評
這項以液態神經網路取代逐格 MLP 的改動,從架構層面直接把時間平滑性寫進模型本身,算是一次低成本的大幅升級。相較於需要 ODE 求解器的連續時間方法,CfC 只在前向傳播中完成,對硬體資源友善,適合在行動裝置或即時渲染管線上部署。從產業觀點看,若能把這個概念擴展到更廣的 3D 重建或動畫生成工作流,將降低開發成本並加速產品化。未來的挑戰在於如何將 LNN 與更複雜的動態場景(如大量非剛體交互)結合,並保證在不同硬體上仍維持低延遲。總體而言,這是一條值得關注的技術路徑,可能會在 AI 驅動的視覺內容產業掀起新一波的效能革命。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。