深度分析
GUI vs CLI 代理人效能比較:執行成功率與瓶頸分析
本研究建立了 440 項跨 18 個應用程式、12 種工作流程的執行層基準,讓螢幕僅能操作的 GUI 代理人與以技能為基礎的 CLI 代理人在相同目標、初始狀態與最終驗證下比較。結果發現,最佳 GUI 代理人(GPT‑5.4)達到 59.1% 完全通過率,優於原始技能層的最佳 CLI 代理人(Codex GPT‑5.5)的 48.2%;
深度分析
本研究建立了 440 項跨 18 個應用程式、12 種工作流程的執行層基準,讓螢幕僅能操作的 GUI 代理人與以技能為基礎的 CLI 代理人在相同目標、初始狀態與最終驗證下比較。結果發現,最佳 GUI 代理人(GPT‑5.4)達到 59.1% 完全通過率,優於原始技能層的最佳 CLI 代理人(Codex GPT‑5.5)的 48.2%;
TuriX
TuriX 是一個把大型語言模型變成「會動手做事」的桌面代理專案,目標讓模型直接在使用者電腦上執行任務。專案提供跨平台示範與 OpenClaw skill,並允許使用者透過設定檔切換自有模型。作者在 README 中列出在 OSWorld 類基準的成功率數據,並以 MIT 授權開放程式碼,強調研究與個人使用免費。
open-computer-use
這個專案受到CodexComputerUse啟發,提出開放原始碼的ComputerUse服務。專案以MCP封裝,實現跨平台桌面使用能力,macOS透過Accessibility與螢幕錄製整合。結果是提供MIT授權的跨平台替代方案,便利各種AI代理接入與測試。將加速桌面自動化在社群中的實驗與部署。