深度分析 評估大型語言模型長程規劃能力:Long‑Horizon‑Terminal‑Bench 與實驗結果 研究推出 Long‑Horizon‑Terminal‑Bench,收錄 46 項跨九大類的長程終端任務,採用子任務密集獎勵機制,讓代理人在完成最終目標前即可獲得部分分數。測試 15 種前沿模型發現,最高通過率僅 15.2%,顯示長程執行仍是主要挑戰與瓶頸。