速報
SciR:首個可控抽取與推理難度的多範式科學推理基準
科學推理常見三種形式:演繹、歸納與因果溯因。現有大型語言模型在科學領域的評測受限於成本高昂且缺乏機制真相的人工標註基準,或是與真實科學文獻相去甚遠的合成測試。研究團隊推出 SciR 基準,結合多範式推理與可控的科學呈現,從形式化的演繹樹、歸納規則假設與因果圖生成題目,確保答案可驗證,並以領域調校的多文件敘事方式呈現。
速報
科學推理常見三種形式:演繹、歸納與因果溯因。現有大型語言模型在科學領域的評測受限於成本高昂且缺乏機制真相的人工標註基準,或是與真實科學文獻相去甚遠的合成測試。研究團隊推出 SciR 基準,結合多範式推理與可控的科學呈現,從形式化的演繹樹、歸納規則假設與因果圖生成題目,確保答案可驗證,並以領域調校的多文件敘事方式呈現。
深度分析
科學AI代理人缺乏前沿評估,COMPOSITE‑STEM 基於 70 項跨領域任務,結合精準與標準化評分,並以 LLM 充當評審。測試四個模型最高僅 21% 成績,顯示現有能力仍受限。此基準開源以推動後續研究。