StainFlow:全新實體染色流獎勵模型提升 GUI 代理人強化學習效能
在長時間、具隨機性的圖形使用者介面(GUI)環境中,傳統的強化學習因為成功回饋過於稀疏,難以為中間的探索步驟分配信用。為解決此問題,研究者提出 StainFlow,一種以實體染色流為基礎的獎勵模型。StainFlow 透過全域實體染色追蹤,客觀分割任務階段;
背景與挑戰
強化學習(RL)在處理長時間、具隨機性的 GUI 任務上展現潛力,但僅靠軌跡層級的成功回饋過於稀疏,無法為中間的探索步驟提供可靠的信用分配。
現有方法的限制
近年研究引入過程獎勵模型(PRM),透過全域里程碑驗證或局部步驟評估提供更細緻的回饋。然而,全域里程碑分解過於主觀且單一,難以涵蓋真實 GUI 任務的多條有效執行路徑;固定的局部判斷窗口則可能遺漏長距離關鍵證據,或被無關畫面稀釋決策訊號。
StainFlow 的創新機制
受網路流分析中染色追蹤機制啟發,研究團隊提出 StainFlow——一套實體染色流過程獎勵模型。
1️⃣ 全域實體染色追蹤(Global Entity Stain Tracking):自動抽取可視化驗證的任務實體,追蹤其染色濃度與狀態在軌跡上的變化。當實體證據流發生顯著變化時,即客觀劃分任務階段,減少主觀分割的影響。
2️⃣ 局部染色證據連結(Local Stain Evidence Linking):以每個候選關鍵節點的觸發實體為中心,根據染色濃度與狀態變化檢索相關步驟,動態構建高密度證據視窗,提升關鍵節點的辨識準確度。
實驗結果
在 AndroidWorld 與 OGRBench 兩套基準測試中,StainFlow 相較於傳統 PRM 方法,線上 RL 成功率提升約 3.2%,軌跡完成判斷正確率提升 1.8%。這顯示更精細的全域與局部回饋機制能有效改善長程 GUI 任務的學習效率。
結論與未來展望
StainFlow 以實體染色流為核心,提供客觀的全域階段分割與動態的局部證據窗口,成功緩解了回饋稀疏與信用分配不均的問題。未來可將此框架擴展至更複雜的跨平台 GUI 任務,並結合更高階的視覺辨識技術,以進一步提升自動化操作的可靠性與效能。
延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。