深度分析
AlayaWorld 登場:15B 參數影片世界模型,挑戰長時互動與空間一致性
AlayaWorld 是一套互動式長時程影片世界模型,基於 15B 參數的擴散變換器,以 24 fps 生成 540p 至 720p 影片。其有界視覺上下文結合固定錨定幀、壓縮時間記憶與空間記憶,並透過抗漂移訓練與四步蒸餾提升穩定性。在 iWorld-Bench 上,AlayaWorld 於生成品質、軌跡追蹤與記憶能力均取得最佳成績。
深度分析
AlayaWorld 是一套互動式長時程影片世界模型,基於 15B 參數的擴散變換器,以 24 fps 生成 540p 至 720p 影片。其有界視覺上下文結合固定錨定幀、壓縮時間記憶與空間記憶,並透過抗漂移訓練與四步蒸餾提升穩定性。在 iWorld-Bench 上,AlayaWorld 於生成品質、軌跡追蹤與記憶能力均取得最佳成績。
深度分析
研究聚焦單張影像或單目影片的全新視角合成,提出 NeoMap 利用預訓練影片模型的資料流形透過交替投影搜尋最佳噪聲初始值,免除額外微調。實驗在 Tanks‑and‑Temples、LLFF 與 DAVIS 三大基準上均超越現有方法,顯著提升視覺真實度與相機一致性。
深度分析
針對影片中人物身份保持的挑戰,研究提出Argus系統,利用堆疊多視角身份馬賽克注入(SMII)將影像證據轉為3×3動態記憶,並結合大語言模型導向與反事實訓練,使生成影片在大幅度側臉、遮蔽與首幀衝突下仍保持高相似度,實驗在OpenS2V與HardID-Celeb基準上創下最高分。
深度分析
影片擴散模型計算昂貴,研究者提出 PASA 以動態算力分配、分組近似與隨機路由降低成本,同時抑制時間閃爍,實驗證實可加速推論並提升畫面流暢度。