深度分析 LLM 代理使用 SageMath 於 RealMath 基準的效能提升與代幣效率探討 隨著大型語言模型在數學研究中的應用提升,研究者將 SageMath 整合至 ReAct 代理框架,提供可驗證的符號回饋。實驗顯示所有模型在工具輔助下平均提升 9.7 個百分點,最高提升 27.8 個百分點,且 GPT‑5.5 在解題率與代幣使用上表現最佳。此結果顯示 CAS 輔助有望縮小開放模型與封閉模型的差距,推動計算數學自動化。