AI 決策能力大考驗:Mini Amusement Parks 模擬器揭露當前系統弱點
人工智慧在真實世界決策中面臨多重挑戰,包括開放式最佳化、從稀疏經驗中學習環境動態、長期規劃、隨機環境下的策略制定,以及空間資訊推理。然而,現有基準測試無法完整評估 AI 在這些面向的整合能力。
儘管人工智慧(AI)近年來進展迅速,但現有系統在處理真實世界決策中的多重挑戰時,仍顯得力不從心。商業管理等實務領域,要求 AI 必須具備開放式最佳化、從稀疏經驗中學習環境動態、在隨機環境中進行長期規劃,以及推理空間資訊的能力。然而,目前的人機互動基準測試,並未針對這些整合能力進行評估。
Mini Amusement Parks 模擬器登場
為填補這項缺口,研究團隊開發了 Mini Amusement Parks(MAPs),這是一款遊樂園模擬器,專門用來評估 AI 代理的環境建模能力、在不確定性下預測長期後果,以及策略性經營複雜商業的能力。研究人員同時提供了人類專家的表現數據,並對當前最先進的 AI 系統進行了全面評測。
人類專家大幅領先 AI
測試結果顯示,人類專家在簡單模式中,表現比 AI 系統高出 11.4 倍;在中等模式下,差距更擴大至 15.3 倍。分析指出,AI 在長期規劃、樣本效率學習、空間推理,以及不確定性建模等方面,仍存在顯著且持續的弱點。
新基準推動 AI 決策能力進步
透過將這些挑戰整合在單一環境中,MAPs 為評估具備適應性決策能力的 AI 代理,提供了全新的基準平台。研究團隊已將相關程式碼開源於 GitHub,供學術界與產業界進一步研究與應用。
延伸閱讀
- THEIA:模組化神經推理引擎實現完整克萊尼三值邏輯與長序列泛化
- SPIRE:以路徑可定位子文件實現結構化且可解釋的證據檢索
- 可分離專家架構(SEA):以可組合 LoRA 與可刪除使用者代理實現 LLM 個人化與刪除驗證
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。