深度分析 SimPref:透過步級偏好學習優化 AI 代理人社交行為 在複雜的社會模擬中,生成式代理人往往缺乏細粒度的行為指導。本研究推出 SimPref 互動介面,讓人類標記員在代理人的規劃、記憶檢索與行動等中間決策步驟中提供即時偏好監督,並建構出包含 5.7 萬組偏好對的資料集。透過 SFT 與 DPO 訓練,開源模型在未知社交情境下的協調能力與行為品質顯著提升,證明步級監督能有效優化長程社交行為。