深度分析
Guide:利用即時影片檢索與自動標註解決 GUI 代理人領域偏差
隨著大型視覺語言模型推動 GUI 代理人能力,缺乏特定軟體操作經驗導致領域偏差。Guide 透過即時影片檢索與自動標註,補足規劃與定位知識,於 OSWorld 測試提升 4.5%~7.5% 成效,顯示影片資源可成為彈性校正工具,此方法免除模型微調與人工標註成本,亦為開放源社群提供快速適配新軟體的路徑。
深度分析
隨著大型視覺語言模型推動 GUI 代理人能力,缺乏特定軟體操作經驗導致領域偏差。Guide 透過即時影片檢索與自動標註,補足規劃與定位知識,於 OSWorld 測試提升 4.5%~7.5% 成效,顯示影片資源可成為彈性校正工具,此方法免除模型微調與人工標註成本,亦為開放源社群提供快速適配新軟體的路徑。
速報
現有 GUI 代理人多在離線或模擬環境訓練,與真實手機使用差距大。研究推出 Xiaomi‑GUI‑0,採原生實機閉環混合架構,結合高頻任務、長尾意圖與錯誤驅動資料飛輪,提升真實環境執行穩定性。測試顯示在 RealMobile 上成功率達 72.0%,顯著改善異常狀態辨識。
深度分析
本研究建立了 440 項跨 18 個應用程式、12 種工作流程的執行層基準,讓螢幕僅能操作的 GUI 代理人與以技能為基礎的 CLI 代理人在相同目標、初始狀態與最終驗證下比較。結果發現,最佳 GUI 代理人(GPT‑5.4)達到 59.1% 完全通過率,優於原始技能層的最佳 CLI 代理人(Codex GPT‑5.5)的 48.2%;
深度分析
研究針對 GUI 代理人在執行閉環任務時的 off‑trajectory 監督缺口,提出 Skill‑Guided Continuation Distillation (SGCD) 以技能引導產生成功延續,實驗顯示在 OSWorld‑Verified 上成功率由 30% 提升至逾 50%。
速報
在長時間、具隨機性的圖形使用者介面(GUI)環境中,傳統的強化學習因為成功回饋過於稀疏,難以為中間的探索步驟分配信用。為解決此問題,研究者提出 StainFlow,一種以實體染色流為基礎的獎勵模型。StainFlow 透過全域實體染色追蹤,客觀分割任務階段;
深度分析
圖形使用者介面(GUI)代理人因KV快取隨交互步驟線性增長而受限,STaR‑KV提出時空自適應重新加權,透過子空間互資訊、時間穩定折扣與熵導溫度三軸校準,於四項基準測試中在相同記憶體預算下提升準確度並減少近40%峰值GPU記憶體效能使用。
深度分析
當前 GUI 代理人缺乏跨任務學習,EchoTrail-GUI 以自動化經驗探索建立成功軌跡資料庫,並在新任務時檢索相關記憶作為上下文提示,實驗顯示在 Android 基準上成功率與效率均有顯著提升,突顯記憶結構化的效益。