深度分析
GroundShot 代理人框架:從實體級記憶體解決多鏡頭視覺漂移問題
目前多鏡頭影片生成常面臨實體特徵漂移問題,導致角色或場景在不同鏡頭間不一致。研究團隊提出 GroundShot 框架,透過建立實體級視覺記憶體並將生成順序與敘事順序解耦,優先生成高品質參考鏡頭以建立標準參考,再將其用於指引引導生成。實驗證明該方法能顯著提升多鏡頭影片的一致性,且無需對模型進行額外訓練或修改。
深度分析
目前多鏡頭影片生成常面臨實體特徵漂移問題,導致角色或場景在不同鏡頭間不一致。研究團隊提出 GroundShot 框架,透過建立實體級視覺記憶體並將生成順序與敘事順序解耦,優先生成高品質參考鏡頭以建立標準參考,再將其用於指引引導生成。實驗證明該方法能顯著提升多鏡頭影片的一致性,且無需對模型進行額外訓練或修改。
深度分析
面對連續多提示長影片生成的語義切換挑戰,研究提出SWIFT,一種在推論階段以語義注入快取與自適應時間窗管理來更新記憶的框架。SWIFT透過頭級語義注入減少重建快取,並以段級語義錨點維繫長距語義一致性,進而兼顧轉場響應與推理效率。實驗顯示在多提示設定下維持生成品質的同時顯著提升效率。