FaraGen1.5 登場:用合成環境與多重驗證器,打造高效電腦操作 AI 代理
收集人類電腦操作示範資料既昂貴又耗時,因此研究人員轉向可擴展的自動生成策略。最新論文提出 FaraGen1.5,這是一套由環境、求解器與驗證器三大模組構成的資料管線,能同時使用真實網站與合成環境,後者專門模擬需登入或涉及不可逆操作的領域。求解器可搭配多種模型(包括 GPT-5.4 等前沿模型),並內建使用者模擬器以支援多輪互動。
訓練電腦操作代理(computer use agent)時,收集人類示範資料既昂貴又耗時,因此學界與業界紛紛轉向可擴展的自動生成策略。最新一篇論文提出了 FaraGen1.5,這是一套模組化的資料管線,由環境、求解器與驗證器三大元件組成,目標是讓代理的訓練資料能夠大規模自動產出。
合成環境補足真實網站限制
FaraGen1.5 同時使用真實網站與合成環境。合成環境專門用來模擬那些需要登入驗證或涉及不可逆操作的領域,例如修改資料庫記錄或執行刪除動作,這些場景在真實網站上難以反覆測試。求解器則可搭配多種模型,包括 GPT-5.4 等前沿模型,並內建使用者模擬器,支援多輪互動的操作軌跡生成。
三種驗證器確保資料品質
資料生成後,管線會透過三種互補的驗證器來評分:任務正確性、操作效率與關鍵點遵循度。這樣的設計確保最終產出的訓練資料不僅完成任務,還能在合理步驟內達成目標。
Fara1.5 模型創下同級最佳成績
利用 FaraGen1.5 產出的資料,研究團隊訓練出 Fara1.5 系列模型,包含 4B、9B 與 27B 三種參數規模,基底為 Qwen3.5。訓練採用監督式微調(SFT),並透過反覆迭代的方式平衡資料覆蓋率、高價值任務與模型弱點修正。在瀏覽器操作基準測試中,Fara1.5-9B 在 Online-Mind2Web 達到 63.4%,在 WebVoyager 達到 86.6%;Fara1.5-27B 在 Online-Mind2Web 達到 72.3%,與規模更大的封閉系統表現相當。
開源釋出降低進入門檻
值得注意的是,所有 Fara1.5 模型權重皆以 MIT 授權釋出,這意味著研究人員與開發者可以自由使用、修改與部署這些模型,不必受限於僅提供 API 的封閉系統。
延伸閱讀
- ConsDreamer:透過VDM與相似性序關係損失校正T2I先驗於3D Gaussian Splatting的視角偏差
- MetaEarth3D:尺度遞進與幾何—材質分離的世界尺度三維生成框架
- FreqFormer:以頻域感知注意力與頻譜路由優化長序列視訊擴散效能
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。