PolyWorkBench:多語言長程工作流程的 LLM 代理人基準測試
研究針對大型語言模型(LLM)代理人在多語言長程工作流程中的表現,推出全新基準 PolyWorkBench,涵蓋商務、知識工作、法律、在地化與製造五大領域,共 67 項任務。測試要求代理人處理多語言輸入、迭代推理、呼叫外部工具並產出結構化結果,並以結構評分、可執行驗證與語意評估三層框架進行評估。
大型語言模型(LLM)代理人在需要長期規劃、工具使用與外部環境互動的任務上表現優異,但大多數測試仍假設單一語言環境。實務上,工作流程常同時處理多語言輸入與輸出,相關研究仍屬空白。
PolyWorkBench 基準介紹
研究團隊推出 PolyWorkBench,針對多語言長程工作流程設計基準,包含商務、知識工作、法律分析、在地化與製造五大領域,共 67 項任務。每項任務要求代理人:
- 處理異質多語言輸入
- 執行迭代推理
- 呼叫外部工具
- 產出結構化、語言一致的結果
評估框架
為捕捉功能正確性與語言一致性,研究採用三層混合評估:
- 結構化評分:檢查輸出格式是否符合規範。
- 可執行驗證:自動執行產出指令或腳本,確認實際可運作。
- LLM 語意評估:利用另一模型判斷語意與上下文的一致性。
實驗結果與發現
測試顯示,最先進的 LLM 代理人在多語言工作流程中的表現比單語言基準下降顯著。分析指出,多語言的加入在推理與執行步驟上產生累積效應,導致錯誤傳遞與決策偏差。
研究呼籲未來的代理人評估與設計,必須同時考量語言變異與程序決策的交互影響,以提升在真實多語環境中的可靠性。
延伸閱讀
- 以受限 WebAssembly 與純度憑證建立可驗證的認知工作流程治理
- 以符號猜想與 LLM 支援的 SCALAR 框架:低深度 QAOA 參數可預測性研究
- SCALAR:在理論物理中以 Actor–Critic–Judge 多回合互動提升 LLM 解題能力
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。