深度分析 可驗證環境驅動的程式碼代理:KAT‑Coder‑V2.5、AutoBuilder、MOPD 之效能評估 隨著程式碼模型從被動補全轉向自主代理,研究提出 KAT‑Coder‑V2.5,利用 AutoBuilder 重新建構可驗證的多語言倉庫,並以 KwaiClawEnv 產生大規模工具使用軌跡。實驗顯示其在 PinchBench 取得最佳工具使用成績,且在倉庫層級軟體工程基準上僅次於 Opus 4.8。