深度分析
WC2026-Agents 基準測試:LLM 代理人預測能力與市場效率的實證分析
本研究利用 2026 年世界盃足球賽 104 場比賽,設計了一個完全無污染的基準測試 WC2026-Agents,用以評估大型語言模型(LLM)作為自主預測代理人的表現。
深度分析
本研究利用 2026 年世界盃足球賽 104 場比賽,設計了一個完全無污染的基準測試 WC2026-Agents,用以評估大型語言模型(LLM)作為自主預測代理人的表現。
深度分析
在以自然語言撰寫的授權政策常有歧義與遺漏的情境下,PolicyBank 提出一種結構化、工具層級的記憶機制,並由專門的政策代理人根據任務軌跡與開發者回饋反覆精修政策解釋。相較現有只在執行層強制或驗證的方案,PolicyBank 將「質疑並改寫」政策理解自動化,能區分執行失敗與規格錯配(alignment failure),