Epi2Diff 框架:以大型推理模型推斷學生題目難度
研究聚焦於教育測驗題目難度預測,提出 Epi2Diff 框架將大型推理模型的推理痕跡轉換為認知情節序列,結合語意特徵以提升預測準確度。實驗顯示在四個真實資料集上均優於現有基線,SAT 測試更獲得 8.1% 的相對提升。結果表明較難題目會產生更迭代且以實作為主的情節動態,證明此方法具可解釋性與實用性。
背景與挑戰
在教育評量中,正確估計題目難度是確保測驗公平與有效的關鍵。傳統方法多依賴人工校正或僅使用題目文字的特徵,難以揭示導致題目困難的認知過程。
Epi2Diff 框架概述
Epi2Diff(Episode to Difficulty)利用大型推理模型(Large Reasoning Models, LRM)產生的推理痕跡,將連續的推理步驟切割並聚類為功能性解題「情節」序列。每個情節代表模型在解題過程中的特定認知狀態,如「搜尋資訊」「建立假設」「實作驗證」等。
框架從情節序列中萃取緊湊的動態特徵,包括:
- 推理規模:情節出現的頻率與長度。
- 努力分配:不同情節的時間與資源投入比例。
- 狀態轉換:情節之間的切換模式。
這些特徵再與題目本身的語意向量結合,形成最終的難度預測模型。
實驗與成果
研究在四個公開的人類難度資料集上進行測試,與多個強基線比較,包括微調小型語言模型、LLM 內嵌學習以及監督式 LLM 調整。Epi2Diff 在所有資料集上皆取得領先表現,特別是在以 SAT 為基礎的分類基準上,較監督式微調基線提升約 8.1% 的相對增益。
進一步分析顯示,較難題目往往觸發更高強度的迭代與實作導向情節,並非僅因回應長度增加。這說明情節動態能夠捕捉到題目對認知資源的實際需求。
意義與未來方向
Epi2Diff 證明了大型推理模型的推理痕跡可轉化為可解釋的認知過程,為教育測量提供了新工具。未來可探索將此框架擴展至即時測驗適應、題目生成與學習者個別化建議等應用。
延伸閱讀
- 「SopriBench」與「Argus」:多模態跨貼文隱私洩漏基準與溯因推理框架解析
- SenBen:以場景圖與知識蒸餾構建可解釋的敏感內容審查基準
- FoodMonitor 基準:以逐幀定位與結構化生成評估廚房合規監測的多模態大語言模型
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。