大型語言模型數位雙生的建構效度與人類測驗比較研究
本研究檢視大型語言模型(LLM)作為人類受測者的數位雙生之心理測量可比性,提出涵蓋構念表徵與共變範圍的建構效度框架,並以人類金標準作為基準進行多項測驗。結果顯示,LLM 在整體層面的準確度與概念輪廓相關性皆可觀,但在單項題目層面的相關性較低。
研究背景與目的
大型語言模型(LLM)被視為人類受測者的數位雙生,但其在心理測量上的可比性仍未確定。研究團隊因此提出一套建構效度框架,涵蓋構念表徵與共變範圍,藉以對照模型與人類金標準的表現。
主要方法與測驗
研究採用多項測驗,包括詞彙聯想測試、決策與情境任務、以及跨語言自由文本任務(英語與中文),並以人類受測者資料作為基準。
核心發現
在整體層面,LLM 能達到高準確度與概念輪廓相關性;然而在單項題目層面的相關性則顯著下降。詞彙聯想測驗顯示,模型具備類似人類的小世界結構與理論一致的社群,但在詞彙選擇與局部結構上仍有差異。決策與情境任務中,模型未能完整再現啟發式偏誤,呈現規範理性、變異壓縮與時間敏感度不足。
加入特徵豐富與特質條件後,模型在五大人格預測與共變範圍對齊上有所提升,但網路不變性仍受限,只能提供部分配置解決方案且載荷差異持續存在。跨語言自由文本任務顯示,特徵豐富的數位雙生在敘事內容上更貼近構念層面,但語言與個體差異仍顯著。
結論與應用範圍
研究指出,數位雙生在已驗證的構念、任務與推論層級下最具實用價值,應在與人類資料相符的範圍內使用。
延伸閱讀
- 「SopriBench」與「Argus」:多模態跨貼文隱私洩漏基準與溯因推理框架解析
- SenBen:以場景圖與知識蒸餾構建可解釋的敏感內容審查基準
- FoodMonitor 基準:以逐幀定位與結構化生成評估廚房合規監測的多模態大語言模型
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。