突破觀測瓶頸:Agent-Computer Observation Interface 讓電腦使用代理更聰明

研究者指出現有的電腦使用(CU)代理在觀測上過度依賴每幾秒的螢幕截圖,導致無法捕捉視訊、動畫、即時 UI 事件與語音指示。為此他們提出 Agent-Computer Observation Interface(AOI),一個與模型無關的感知層,透過關鍵影格捕捉、音量門控語音轉錄與視覺敘事文字化三個模組,將持續觀測與離散動作解耦。

代理觀測介面提升效能

觀測瓶頸成為 CU 代理的限制

目前市面上開源與閉源的電腦使用(CU)代理,觀測方式幾乎都綁定在動作上——每 3 到 5 秒抓一次螢幕截圖,且不處理音訊,導致在影片、動畫、即時 UI 事件、會議與語音指示等情況下,代理如同失明失聰。

AOI:解耦觀測與動作的全新介面

研究團隊提出 Agent-Computer Observation Interface(AOI),一個模型無關的感知層,透過三個閘控元件實現持續且彈性的觀測:

  • 步驟間關鍵影格捕捉:在動作間隔抽取代表性畫面。
  • 音量門控語音轉錄:只有音量超過門檻時才做語音文字化。
  • CU 模型產生的視覺敘事:將捕捉到的畫面轉為持續的文字描述。

在靜態、無聲內容上,這三個元件幾乎不產生額外負擔,仍保留原有的截圖迴路。

實驗結果顯著提升

在 DynaCU-Bench(100 個動態瀏覽器任務與 50 個靜態對照)測試中,從 7B 規模到最先進的模型,加入 AOI 後正確率提升 17 至 48 個百分點,且不需要重新訓練模型。尤其在語音子集上,AOI 代理能解決所有任務;相較之下,僅能聽取語音的模型無法將資訊轉化為動作。

關鍵發現與未來方向

實驗顯示,關鍵影格的選取本身影響不大,真正的價值來自於將畫面敘事化為持續文字。介面組合亦非固定;在較新模型(如 Gemini 3 Flash)中,影格串流因影像 token 稀釋反而退步,需針對模型調整元件配置。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more