深度分析
利用 TRACE 評估 LLM 教學助理在答案鍵情境下的推理提前性
本研究針對大型語言模型教學助理探討答案驅動推理問題,提出TRACE截斷式思考鏈審計方法,以不同答案鍵情境測試1000題GSM8K。結果顯示,提供正確答案鍵可使金標答案在前10%推理前綴即被回收,AUC從0.375提升至0.900。此技術為教育AI的過程層面可靠性提供輕量化診斷。
深度分析
本研究針對大型語言模型教學助理探討答案驅動推理問題,提出TRACE截斷式思考鏈審計方法,以不同答案鍵情境測試1000題GSM8K。結果顯示,提供正確答案鍵可使金標答案在前10%推理前綴即被回收,AUC從0.375提升至0.900。此技術為教育AI的過程層面可靠性提供輕量化診斷。
深度分析
基準資料集常被背誦與污染,難以檢驗推理廣泛性。GSM-SEM 以「答案不變、語意變化」的方法隨機生成題目變體,保留計算過程但改變敘事脈絡。評測顯示多數大型模型在語意擾動下表現顯著下滑,突顯現有領先分數的脆弱性。此框架可重複產生新變體,減少對靜態測試集的記憶偏誤。