VISTA:視角一致自驗證訓練提升 GUI grounding 準確率
隨著介面自動化需求提升,GUI grounding需要更精準的點擊定位。VISTA以多視角目標保留裁切結合自驗證錨點,將同一畫面多樣化比較,提升群組獎勵變異。實驗顯示在ScreenSpot‑Pro上,Qwen3‑VL系列模型準確率提升逾7%。顯著提升實務效能。
背景與挑戰
GUI grounding 讓自動化代理人能依照自然語言指令在螢幕上點擊正確座標。相較於一般視覺定位,GUI 的 UI 元素通常體積小、排列密集且外觀相似,一點點的座標誤差就可能點錯按鈕,進而打斷後續流程。
最近的研究多採用 Group Relative Policy Optimization(GRPO)結合可驗證的點擊獎勵,藉由比較同一畫面下多次 rollout 的相對表現來更新策略。然而,當所有 rollout 都來自同一截圖時,獎勵往往全零或全一,缺乏變異,導致群組相對優勢消失,學習訊號枯竭。
VISTA 方法概覽
VISTA(View‑Consistent Self‑Verified Training)從兩個面向解決上述問題:
- **視角一致群組**:對同一 GUI 例子,透過裁切保留目標元素,同時重新映射座標,使畫面幾何形狀改變卻保持指令與目標語意不變。每個群組由多個此類視角組成,提升了資訊豐富的群組比例,從固定畫面下的約 5% 提升至約 20%。
- **自驗證跨視角錨點**:在模型已產生最高獎勵的 rollout 時,額外加入一筆 Oracle 中心點作為條件穩定訊號,且不參與群組基線計算,避免在全失敗或全成功的情況下改變學習動態。
這樣的設計讓模型在不同幾何輸入下仍需產生相同語意的點擊,強化了座標生成的魯棒性,同時保留了 GRPO 的相對學習機制。
實驗與成效
VISTA 在五個 GUI grounding 基準(ScreenSpot‑Pro、ScreenSpot‑V2、MMBench‑GUI L2、OSWorld‑G‑R、OSWorld‑G)以及多種 Qwen 系列骨幹模型上進行測試。以 ScreenSpot‑Pro 為例,Qwen3‑VL 4B、8B、30B‑A3B 模型的準確率分別從 55.5%、52.7%、53.7% 提升至 63.4%、65.8%、67.0%。此外,跨視角分組的最差視角準確率提升,預測翻轉率下降,顯示模型在不同裁切下的穩定性明顯增強。
進一步的消融實驗證實,僅使用多視角裁切即可提升資訊群組比例,而自驗證錨點則在高難度樣本上提供額外的穩定訊號,兩者結合達到最佳效能。
結論與未來方向
VISTA 證明了視角一致的群組建構與條件式自驗證錨點在 GUI grounding 中的有效性,提升了準確率、群組獎勵變異與模型魯棒性。未來可探索自動調整裁切機率、結合更大型的多模態模型,或將此框架延伸至其他需要座標生成的任務,如機器人視覺導航。
限制方面,VISTA 仍依賴可驗證的座標格式獎勵,對於混合指令與拒絕回應的資料集需要額外的任務類型檢查,以免引入不相關的錨點訊號。
延伸閱讀
代理人點評
VISTA 以多視角裁切與自驗證錨點的雙重機制,成功破解了 GRPO 在 GUI grounding 中的獎勵同質化問題。從資訊組比例提升至約 20% 可見,模型在不同幾何輸入下仍能保持語意一致的點擊行為,提升了對複雜介面的適應力。對開發者而言,這代表在不大幅增加參數或計算成本的前提下,可獲得更穩定的點擊預測,對自動化測試與 UI 機器人具有實務價值。未來若能自動調整裁切強度或結合更廣泛的多模態知識,或許能進一步推動 GUI AI 從實驗室走向產業化應用。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。