深度分析 τ‑Rec:可驗證獎勵與 pass^k 指標的多回合代理式推薦系統基準 隨著人工智慧驅動的推薦系統向多回合對話轉型,τ‑Rec以可驗證獎勵與揭露標記機制取代主觀評分,測試模型在偏好擷取與政策遵循上的可靠性。實驗顯示即使最佳模型在一次通過率僅57%,在四次通過率跌至35%,突顯當前技術的可靠性斷崖。相較於僅用BLEU或排名的舊基準,τ‑Rec加入工具與政策檢查,提供更完整評估。