深度分析
LLM 代理使用 SageMath 於 RealMath 基準的效能提升與代幣效率探討
隨著大型語言模型在數學研究中的應用提升,研究者將 SageMath 整合至 ReAct 代理框架,提供可驗證的符號回饋。實驗顯示所有模型在工具輔助下平均提升 9.7 個百分點,最高提升 27.8 個百分點,且 GPT‑5.5 在解題率與代幣使用上表現最佳。此結果顯示 CAS 輔助有望縮小開放模型與封閉模型的差距,推動計算數學自動化。
深度分析
隨著大型語言模型在數學研究中的應用提升,研究者將 SageMath 整合至 ReAct 代理框架,提供可驗證的符號回饋。實驗顯示所有模型在工具輔助下平均提升 9.7 個百分點,最高提升 27.8 個百分點,且 GPT‑5.5 在解題率與代幣使用上表現最佳。此結果顯示 CAS 輔助有望縮小開放模型與封閉模型的差距,推動計算數學自動化。
深度分析
計算數學的開放問題長期需要結合數值實驗與證明構造。研究團隊推出 Iteris 代理式研究系統,以 explore‑plan‑execute 迴路自動生成數據、構造與證明草稿,經專家修正後得到兩項新結果:CG 與隨機座標下降在冪律譜上的相位圖,以及 QR 分解在低相干情況下的反例。此案例顯示 AI 能在數學工作流中提供實質助力,但仍需人工驗證。