深度分析 PPT‑Eval:針對 PowerPoint 多模態操作的基準測試與模型表現分析 隨著企業與學術單位大量使用簡報,研究推出PPT‑Eval基準,涵蓋120項PowerPoint線上任務並使用細緻評分規範,測試顯示即使是Claude‑4.5‑Opus等先進模型成功率僅45%,遠低於人類80%,凸顯實務挑戰。此結果顯示現行AI代理人在多模態圖形介面操作仍有顯著缺口。