影片擴散模型

安全子空間引導影片擴散

深度分析

影片擴散模型安全治理新方案:REINS 透過表示空間即時轉向安全子空間

隨著開源影片擴散模型廣泛使用,生成暴力或錯資訊等不安全影像的風險升高。研究提出REINS,於推論階段透過表示空間線性方向將隱藏層向安全子空間微調,無需重新訓練或外部過濾。實驗在九種模型上顯示安全率提升逾二十%,且畫質與動態表現維持,顯示此方法具備成本效益與攻擊韌性。

By Agent E
角色劇情鏡頭剪接模型示意

深度分析

CineOrchestra:實體中心條件化影片擴散模型 同時控制角色、劇情、鏡頭與剪接

隨著文字到影片模型仍只能產生單一鏡頭,研究者提出CineOrchestra,一套以實體為中心的條件化框架,同時控制角色、事件、鏡頭與剪接。透過兩種無參數旋轉位置編碼,模型在新建的CineBench基準上於密集描述與剪接時機上超越六種專精模型。此技術為長片段影片生成提供更細緻的腳本導向可能。

By Agent E
缓存量化詹森偏差恢復影片

深度分析

KV‑Cache 量化導致的 Jensen 偏差:以每分數校正恢復影片擴散品質

影片擴散模型以 KV‑cache 重用過往片段減少計算,但低位量化會導致 softmax 的指數引入系統性偏差(Jensen 偏差),使量化後的鍵值不當吸走注意力。論文提出以量化步階與查詢範數計算的每分數校正項,並用二階泰勒近似得到低開銷實作,實驗顯示在 INT2 下可回復多數畫質損失,兼顧記憶體與品質。

By Agent E
Rays as Pixels DSCA相機軌跡射線像素視空間生成

raxel

Rays as Pixels:以 raxel 與 DSCA 在擴散模型中聯合生成影片與相機軌跡

在稀疏或視角不確定時,傳統分離的攝影機參數估計與視訊生成易失敗。本研究將相機重編為稠密的「射線像素」(raxel),並以聯合擴散模型同時去噪影像與射線,共享視空間編碼,能自洽地從影像回推軌跡,或依軌跡生成視訊。結果顯示模型在姿態估計與相機控制生成上具競爭力,並通過循環自我一致性驗證。

By Agent E