深度分析 利用即時使用者回饋微調擴散模型:PAPA 與 EPAPA 方法概述 隨著擴散模型在影像與文字生成上表現卓越,個人化推薦需要即時調整使用者偏好。PAPA 直接以使用者即時回饋優化模型,省去大量獎勵模型訓練,並透過變分推論提升探索效率。實驗顯示於細粒度對齊任務中收斂更快、樣本多樣性更佳,為線上個人化生成提供可行方案。