深度分析 Who&When Pro:大型多模態 AI 代理失敗歸因基準正式釋出 隨著AI代理能力提升,失敗變得更微妙,研究團隊推出Who&WhenPro基準,透過自動錯誤注入產生12,326筆跨文字、影像、影片的失敗軌跡,證實即使是大型模型仍在定位與診斷錯誤上有顯著挑戰。該基準涵蓋文字、影像、影片三種模態,且支援單代理與多代理情境,實驗顯示開源模型具成本效益,有望促進自我改進代理系統。