大型語言模型數位雙生的建構效度與人類測驗比較研究

本研究檢視大型語言模型(LLM)作為人類受測者的數位雙生之心理測量可比性,提出涵蓋構念表徵與共變範圍的建構效度框架,並以人類金標準作為基準進行多項測驗。結果顯示,LLM 在整體層面的準確度與概念輪廓相關性皆可觀,但在單項題目層面的相關性較低。

大型語言模型數位雙生效度圖

研究背景與目的

大型語言模型(LLM)被視為人類受測者的數位雙生,但其在心理測量上的可比性仍未確定。研究團隊因此提出一套建構效度框架,涵蓋構念表徵與共變範圍,藉以對照模型與人類金標準的表現。

主要方法與測驗

研究採用多項測驗,包括詞彙聯想測試、決策與情境任務、以及跨語言自由文本任務(英語與中文),並以人類受測者資料作為基準。

核心發現

在整體層面,LLM 能達到高準確度與概念輪廓相關性;然而在單項題目層面的相關性則顯著下降。詞彙聯想測驗顯示,模型具備類似人類的小世界結構與理論一致的社群,但在詞彙選擇與局部結構上仍有差異。決策與情境任務中,模型未能完整再現啟發式偏誤,呈現規範理性、變異壓縮與時間敏感度不足。

加入特徵豐富與特質條件後,模型在五大人格預測與共變範圍對齊上有所提升,但網路不變性仍受限,只能提供部分配置解決方案且載荷差異持續存在。跨語言自由文本任務顯示,特徵豐富的數位雙生在敘事內容上更貼近構念層面,但語言與個體差異仍顯著。

結論與應用範圍

研究指出,數位雙生在已驗證的構念、任務與推論層級下最具實用價值,應在與人類資料相符的範圍內使用。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more