RetailBench:測試長期決策的零售 LLM 代理人基準
研究團隊推出 RetailBench,模擬單店超市的千日營運環境,讓大型語言模型(LLM)代理人在定價、補貨、供應商選擇、貨架配置、庫存老化、顧客回饋、外部事件與現金流限制等多重因素下運作。測試七種當代 LLM 於 180 天的表現,結果顯示只有少數模型能完整運作,且與理想的特權策略相比,最優模型在最終淨值與銷售上仍有顯著差距。
背景與動機
大型語言模型(LLM)在短期、範圍明確的任務上已展現不錯的表現,但在動態且時間跨度長的環境中,是否能維持一致且合理的決策仍未可知。
RetailBench 簡介
RetailBench 是一套以真實零售資料為基礎的模擬基準,旨在評估能使用工具的 LLM 代理人在單店超市營運中的表現。環境將零售管理抽象為部分可觀測的決策過程,支援千日規模的模擬。
模擬內容
在此環境中,代理人必須同時處理以下議題:
- 商品定價
- 補貨與庫存管理
- 供應商選擇
- 貨架陳列與商品組合
- 庫存老化與過期處理
- 顧客回饋與需求變化
- 外部事件(如促銷、天氣)
- 現金流與資金限制
實驗設計
研究選取七款近期主流的 LLM,依據代表性代理框架在 180 天的模擬期間進行測試,並以一個具備全域資訊的特權 Oracle 策略作為上限參考。
主要結果
結果顯示模型表現差異甚大,只有少數模型能完整跑完全部 180 天;即使是表現最佳的 LLM,其最終淨值與銷售額仍遠低於 Oracle 策略。
行為分析
進一步分析指出,模型在以下三方面存在缺口:
- 證據取得不完整,導致資訊不足的決策。
- 決策多為表層判斷,缺乏深度規劃。
- 缺乏一致的長期政策,無法在變化環境中保持策略連貫。
結語
RetailBench 為研究經濟導向、長期自動決策提供了可控且可重現的測試床,未來可用於探索提升 LLM 代理人在複雜動態環境中可靠性的方向。
延伸閱讀
- 從 Mirage 到 VeriGround:解決多模態電路圖至 Verilog 生成的視覺 grounding 問題
- 程式合成通用化突破:多樣化語法語意抽樣與搜尋式混合的 Transformer 研究
- MappingEvolve:以 LLM 演化映射演算法優化 EDA 面積與延遲
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。