Epi2Diff 框架:以大型推理模型推斷學生題目難度

研究聚焦於教育測驗題目難度預測,提出 Epi2Diff 框架將大型推理模型的推理痕跡轉換為認知情節序列,結合語意特徵以提升預測準確度。實驗顯示在四個真實資料集上均優於現有基線,SAT 測試更獲得 8.1% 的相對提升。結果表明較難題目會產生更迭代且以實作為主的情節動態,證明此方法具可解釋性與實用性。

大型推理模型預測題目難度

背景與挑戰

在教育評量中,正確估計題目難度是確保測驗公平與有效的關鍵。傳統方法多依賴人工校正或僅使用題目文字的特徵,難以揭示導致題目困難的認知過程。

Epi2Diff 框架概述

Epi2Diff(Episode to Difficulty)利用大型推理模型(Large Reasoning Models, LRM)產生的推理痕跡,將連續的推理步驟切割並聚類為功能性解題「情節」序列。每個情節代表模型在解題過程中的特定認知狀態,如「搜尋資訊」「建立假設」「實作驗證」等。

框架從情節序列中萃取緊湊的動態特徵,包括:

  • 推理規模:情節出現的頻率與長度。
  • 努力分配:不同情節的時間與資源投入比例。
  • 狀態轉換:情節之間的切換模式。

這些特徵再與題目本身的語意向量結合,形成最終的難度預測模型。

實驗與成果

研究在四個公開的人類難度資料集上進行測試,與多個強基線比較,包括微調小型語言模型、LLM 內嵌學習以及監督式 LLM 調整。Epi2Diff 在所有資料集上皆取得領先表現,特別是在以 SAT 為基礎的分類基準上,較監督式微調基線提升約 8.1% 的相對增益。

進一步分析顯示,較難題目往往觸發更高強度的迭代與實作導向情節,並非僅因回應長度增加。這說明情節動態能夠捕捉到題目對認知資源的實際需求。

意義與未來方向

Epi2Diff 證明了大型推理模型的推理痕跡可轉化為可解釋的認知過程,為教育測量提供了新工具。未來可探索將此框架擴展至即時測驗適應、題目生成與學習者個別化建議等應用。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more