深度分析 「DailyReport 基準」評估搜尋代理人於大型語言模型的事實性與推理表現 DailyReport 基準針對真實使用者的日常資訊需求,收集 150 個開放式搜尋任務與 3,546 條細部評分規範,覆蓋 10 大領域與 35 細分類。基於層疊式 rubrics,從指令遵循、事實性、推理合理性三個維度逐層評分,並以使用者偏好分數進行彙總。