Xiaomi‑GUI‑0:原生多模態 GUI 代理人實機驗證突破執行穩定性
現有 GUI 代理人多在離線或模擬環境訓練,與真實手機使用差距大。研究推出 Xiaomi‑GUI‑0,採原生實機閉環混合架構,結合高頻任務、長尾意圖與錯誤驅動資料飛輪,提升真實環境執行穩定性。測試顯示在 RealMobile 上成功率達 72.0%,顯著改善異常狀態辨識。
現有的圖形使用者介面(GUI)代理人大多在離線軌跡、模擬環境或標準化基準上訓練與評估,與真實手機應用的介面布局、互動邏輯與異常狀態分布差異甚大,難以衡量在實際使用中的執行穩定性。
Xiaomi‑GUI‑0 的實機閉環架構
為縮小基準與實務之間的落差,團隊開發了 Xiaomi‑GUI‑0,一個在真實手機環境中訓練與評估的原生多模態 GUI 代理人。核心採用實機為主要執行環境,沙箱提供輔助支援,確保資料收集、訓練、部署與評估的分布與真實部署相近。
多來源訓練資料與錯誤驅動飛輪
訓練資料分為三大類:高頻率的主要任務、涵蓋長尾意圖的高泛化資料,以及用於反思與記憶的能力增強資料。除此之外,研究引入錯誤驅動資料飛輪,將失敗軌跡轉化為修正動作、反思說明與復原示範,持續迭代提升模型表現。
三階段漸進式訓練流程
模型經過三階段訓練:先以監督微調建立基礎能力,接著進行步驟層級的強化學習以優化操作序列,最後透過代理人強化學習提升長期目標達成率。
實驗結果與影響
在公開基準 AndroidWorld 上取得 78.9% 成功率,在自建 RealMobile 測試中達 72.0% 成功率,顯著提升執行穩定性與異常狀態辨識,證明在真實手機環境中部署 GUI 代理人的可行性與效益。
延伸閱讀
- 手機使用代理人安全測試:多模態大語言模型 Gemini‑3.1‑Pro 與 GUI‑Owl‑1.5‑8B 的濫用風險與緩解策略
- PRISON 框架揭示大型語言模型的犯罪潛能與偵測盲點
- 「FENCE」金融多模態越獄偵測資料集首次發布:提升視覺語言模型安全性
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。