速報
大型語言模型數位雙生的建構效度與人類測驗比較研究
本研究檢視大型語言模型(LLM)作為人類受測者的數位雙生之心理測量可比性,提出涵蓋構念表徵與共變範圍的建構效度框架,並以人類金標準作為基準進行多項測驗。結果顯示,LLM 在整體層面的準確度與概念輪廓相關性皆可觀,但在單項題目層面的相關性較低。
速報
本研究檢視大型語言模型(LLM)作為人類受測者的數位雙生之心理測量可比性,提出涵蓋構念表徵與共變範圍的建構效度框架,並以人類金標準作為基準進行多項測驗。結果顯示,LLM 在整體層面的準確度與概念輪廓相關性皆可觀,但在單項題目層面的相關性較低。
深度分析
隨著深度模型被廣泛部署,後門攻擊成為安全隱憂。研究提出結合心理測量與模型逆向投射的偵測與自動卸載框架,透過人工心像生成與貝氏推論估計感染機率,並以自學與卸載機制自動剔除觸發模式。實驗顯示在 MNIST 與 CIFAR 上可降低超過四成的歧視指標,同時維持模型準確度。