SciR:首個可控抽取與推理難度的多範式科學推理基準
科學推理常見三種形式:演繹、歸納與因果溯因。現有大型語言模型在科學領域的評測受限於成本高昂且缺乏機制真相的人工標註基準,或是與真實科學文獻相去甚遠的合成測試。研究團隊推出 SciR 基準,結合多範式推理與可控的科學呈現,從形式化的演繹樹、歸納規則假設與因果圖生成題目,確保答案可驗證,並以領域調校的多文件敘事方式呈現。
科學推理主要包含演繹、歸納與因果溯因三種範式。現有的大型語言模型(LLM)在科學情境下的評測仍不完善:人工標註的科學基準成本高且缺乏機制真相,而合成的邏輯推理測試又與真實科學文件相去甚遠。
SciR 基準的設計理念
SciR 結合多範式推理與可控的科學呈現,從三種形式化物件——演繹樹、歸納規則假設、因果圖——生成題目,確保答案可驗證。題目再以每個範式專屬的領域調校文體,渲染成多文件科學論述。
可獨立調整的兩條難度軸
此建構允許獨立變化兩個難度面向:
- 抽取關鍵資訊的難度:即從多文件敘事中找出推理所需的核心內容。
- 推理本身的難度:即在已取得資訊後完成正確的演繹、歸納或因果推斷。
兩軸的組合可產生不同挑戰層級,便於細緻評估模型的抽取與推理能力。
模型測試結果
研究測試了六種模型,結果顯示兩條難度軸皆會降低模型表現,且效應會相互疊加。即使是將推理交給已驗證求解器的神經符號管線,也因渲染過程受到影響而表現下降。從模型的抽取‑推理輪廓來看,像 deepseek‑r1 這類以推理為主的模型在推理軸上普遍優於非推理指令模型。
意義與未來應用
截至目前,SciR 是首個具備抽取與推理難度參數控制的多範式科學推理基準,為未來開發更具機制可解釋性的科學 AI 提供了可量化的測試平台。
延伸閱讀
- EPC-AW:LLM 多代理系統的規劃認知校準工作流程與實驗結果
- A-LEMS 能耗觀測:EpG 與 OOI 在代理式 AI 編排效率評估上的應用
- 行動端 LLM 能耗實測:量化悖論、MoE 與 Qwen2.5-3B 的折衷
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。