StarDojo 基準測試:評估多模態大語言模型在開放式生產生活模擬中的能力
研究團隊推出 StarDojo,利用《星露谷物語》打造的開放式模擬環境,針對 AI 代理人在農耕、製作、探索、戰鬥與社交五大領域的生產與生活技能進行綜合評估。基準提供 1,000 項精選任務與 100 �項精簡子集,支援無鍵鼠介面、跨平台與多實例平行執行,適合測試以多模態大型語言模型(MLLM)為基礎的先進代理人。
研究團隊發表了名為 StarDojo 的新基準,旨在同時評估 AI 代理人在生產活動與社交互動兩方面的表現。此基準以《星露谷物語》為模擬基礎,讓代理人必須完成耕作、製作、探索、戰鬥與社交等五大領域的任務,同時在活潑的社群中建立關係。
任務設計與執行環境
StarDojo 包含 1,000 個精心挑選的任務,另提供 100 個具代表性的子集以加速模型評估。測試平台提供統一且使用者友善的介面,免除鍵盤與滑鼠操作,支援 Windows、macOS 與 Linux,並可平行執行多個環境實例,特別適合以多模態大型語言模型(MLLM)為核心的基礎模型進行測試。
實驗結果與挑戰
研究者對多個最先進的 MLLM 代理人進行廣泛測試,結果顯示目前的技術仍有顯著限制。表現最佳的 GPT‑4.1 只達到 12.7% 的成功率,主要瓶頸來自於視覺資訊的理解、跨模態推理以及低階操作的精細度。
未來展望
作為一個易於使用且具擴充性的測試環境,StarDojo 希望能促進研究者開發更具韌性、能在複雜生產與生活情境中自主運作的開放式代理人,推動人工智慧在真實世界應用的進一步突破。
延伸閱讀
- DART:運行時語意可受理性與回滾可接受性檢查
- FactoryFlow:以密度保存中介表示與人機監督強化LLM輔助的數位孿生建模(含DataFITR、FactorySimPy)
- COSMO-Agent:以工具輔助強化學習連結 CAD 與 CAE 的閉環設計優化
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。