深度分析 ASyMOB 基準評測:大型語言模型在符號數學上的脆弱與突破 研究提出全新ASyMOB基準,專注大語言模型在大學層級符號數學的操作能力,透過數值與符號擾動測試模型是否僅靠記憶模式。測試顯示即使高準確模型在擾動下表現下降近70%,而具程式碼執行功能的模型在部分擾動上可提升30%。此結果暗示未來可能需要更深度的工具整合或更強的符號推理模型。