深度分析 ProEvent 評測揭示 LLM 主動代理事件追蹤能力:GPT-5.1 多步驟正確率僅 26.7% 主動代理須預測使用者事件並適時協助,但既有評測缺乏此類任務。ProEvent 首創從即時通訊對話中主動維護行事曆的基準,以客觀正確性指標評估。測試八個模型發現,GPT-5.1 也僅在 26.7% 的情境中正確回應,且對事件取消普遍處理不佳,顯示當前 AI 代理仍有根本局限。