深度分析
EvoCUA-1.5:透過在線強化學習突破靜態數據牆,實現電腦操作代理人自我進化
針對電腦操作代理人難以處理長路徑任務的問題,EvoCUA-1.5 提出在線強化學習框架,將學習重心從靜態軌跡轉向動態交互。核心技術包含步級策略優化 STEPO 以修正獎勵偏差,以及動態三適應課程 DTAC 提升樣本效率,並搭配非同步基礎設施解決環境交互緩慢的瓶頸。結果顯示其在 OSWorld-Verified 成功率達 63.2%,效能逼近超大規模模型。
深度分析
針對電腦操作代理人難以處理長路徑任務的問題,EvoCUA-1.5 提出在線強化學習框架,將學習重心從靜態軌跡轉向動態交互。核心技術包含步級策略優化 STEPO 以修正獎勵偏差,以及動態三適應課程 DTAC 提升樣本效率,並搭配非同步基礎設施解決環境交互緩慢的瓶頸。結果顯示其在 OSWorld-Verified 成功率達 63.2%,效能逼近超大規模模型。
代理型人工智慧
面對從研究到生產部署的轉變,評估代理型人工智慧成為關鍵。本文比較七項基準,涵蓋軟體修補、自主網頁導航、多步工具使用、策略與工具互動一致性、視覺抽象推理、跨系統電腦操控與跨領域廣度,解析每項測試的能力指標與意義。結論為無單一分數可代表整體能力,須綜合不同基準並考量測試架構差異。