DecompSR:大型語言模型空間推理組合能力基準
研究推出DecompSR大規模空間推理基準,收錄逾五百萬筆資料,能獨立調整推理深度、實體變化、輸入順序與新詞彙等組合性。此基準以程序化方式生成,並透過符號求解器驗證正確性,提供可細緻探測模型組合推理的工具。測試顯示大型語言模型在生產性與系統性推理上仍有不足。
DecompSR 基準概述
研究團隊推出 DecompSR,作為一套超過五百萬筆資料的空間推理基準,旨在深入分析大型語言模型的組合推理能力。資料集以程序化方式產生,確保每筆樣本在建構上即為正確,並使用符號求解器進行獨立驗證,以保證資料的正確性。
可變組合性維度
DecompSR 允許使用者獨立調整四大組合性面向:
- 生產力(推理深度)
- 替代性(實體與語言變異)
- 過度概化(輸入順序、干擾項)
- 系統性(新詞彙與語法元素)
測試結果
在多款大型語言模型上進行全面基準測試後,發現模型在面對深度與系統性推理時表現不佳,易受組合性變化影響;相較之下,對語言變異的適應力較為穩定。這顯示目前的模型仍需加強對組合推理的泛化能力。
意義與未來應用
DecompSR 提供了一個可證明正確且可細緻調整組合性因素的測試平台,讓研究者能更精確地探測與提升大型語言模型在空間推理任務中的組合能力,預期將推動相關領域的模型設計與評估方法進一步發展。
延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。