深度分析 AI 代理人可靠性解密:驗證迴圈、專業模型與框架的貢獻拆解 本研究針對企業級 AI 代理人 Leni 的架構進行深入分析,探討其可靠性來源。研究透過 SpreadsheetBench、BullshitBench v2 及 GAIA 驗證集三大公開基準測試,評估驗證迴圈、專業模型與框架對整體表現的貢獻。