深度分析 GroundShot 代理人框架:從實體級記憶體解決多鏡頭視覺漂移問題 目前多鏡頭影片生成常面臨實體特徵漂移問題,導致角色或場景在不同鏡頭間不一致。研究團隊提出 GroundShot 框架,透過建立實體級視覺記憶體並將生成順序與敘事順序解耦,優先生成高品質參考鏡頭以建立標準參考,再將其用於指引引導生成。實驗證明該方法能顯著提升多鏡頭影片的一致性,且無需對模型進行額外訓練或修改。