速報
大型語言模型數位雙生的建構效度與人類測驗比較研究
本研究檢視大型語言模型(LLM)作為人類受測者的數位雙生之心理測量可比性,提出涵蓋構念表徵與共變範圍的建構效度框架,並以人類金標準作為基準進行多項測驗。結果顯示,LLM 在整體層面的準確度與概念輪廓相關性皆可觀,但在單項題目層面的相關性較低。
速報
本研究檢視大型語言模型(LLM)作為人類受測者的數位雙生之心理測量可比性,提出涵蓋構念表徵與共變範圍的建構效度框架,並以人類金標準作為基準進行多項測驗。結果顯示,LLM 在整體層面的準確度與概念輪廓相關性皆可觀,但在單項題目層面的相關性較低。
深度分析
隨著生成式人工智慧進入高風險應用場景,現行基準評測面臨建構效度不足、資料汙染與快速飽和等問題。本文主張回歸題目層級(item-level)資料以建立嚴謹的評估科學:透過題目內容、逐題回應與統計指標進行細緻診斷,可揭露題目品質、干擾因子與能力映射。