深度分析
「τ‑Rec」基準揭示代理式推薦系統多回合推理瓶頸與可驗證獎勵機制
隨著推薦系統向多回合對話式代理轉型,傳統評測已無法跟上。研究推出τ‑Rec基準,以可驗證獎勵與揭露標籤機制取代主觀評分,測試六大模型在電影目錄上的偏好引導與政策遵循,結果顯示最佳模型的pass^1僅約57%,pass^4跌至約35%,凸顯可靠性斷崖。
深度分析
隨著推薦系統向多回合對話式代理轉型,傳統評測已無法跟上。研究推出τ‑Rec基準,以可驗證獎勵與揭露標籤機制取代主觀評分,測試六大模型在電影目錄上的偏好引導與政策遵循,結果顯示最佳模型的pass^1僅約57%,pass^4跌至約35%,凸顯可靠性斷崖。
深度分析
隨著人工智慧驅動的推薦系統向多回合對話轉型,τ‑Rec以可驗證獎勵與揭露標記機制取代主觀評分,測試模型在偏好擷取與政策遵循上的可靠性。實驗顯示即使最佳模型在一次通過率僅57%,在四次通過率跌至35%,突顯當前技術的可靠性斷崖。相較於僅用BLEU或排名的舊基準,τ‑Rec加入工具與政策檢查,提供更完整評估。