深度分析 TestEvo‑Bench:AI 代理人測試生成與更新的共演進基準 軟體開發中程式碼與測試需同步演進,但現有 AI 評測多聚焦於靜態快照。研究團隊推出 TestEvo-Bench,透過挖掘真實 Java 開源專案的提交紀錄,建立包含測試生成與更新的動態基準,並要求 AI 代理人產出的測試必須經過實際執行驗證。實驗顯示頂尖 AI 代理人雖有不錯的成功率,但在最新任務與成本限制下表現明顯下滑。