深度分析
PPT‑Eval:針對 PowerPoint 多模態操作的基準測試與模型表現分析
隨著企業與學術單位大量使用簡報,研究推出PPT‑Eval基準,涵蓋120項PowerPoint線上任務並使用細緻評分規範,測試顯示即使是Claude‑4.5‑Opus等先進模型成功率僅45%,遠低於人類80%,凸顯實務挑戰。此結果顯示現行AI代理人在多模態圖形介面操作仍有顯著缺口。
深度分析
隨著企業與學術單位大量使用簡報,研究推出PPT‑Eval基準,涵蓋120項PowerPoint線上任務並使用細緻評分規範,測試顯示即使是Claude‑4.5‑Opus等先進模型成功率僅45%,遠低於人類80%,凸顯實務挑戰。此結果顯示現行AI代理人在多模態圖形介面操作仍有顯著缺口。
深度分析
隨著大型語言模型被稱為「編碼代理」與「AI 共科學家」的標籤,本文區分外部流程驅動的 Agentic 系統與內部自發的 Agentive 系統,提出 Goal‑Identity‑Configurator (GIC) 架構作為未來通用代理模型的藍圖,強調僅靠工具串接無法實現自主目標分解與自我調節。