全新 Moral Trolley Arena:測試大型語言模型道德證據組合能力

研究者提出 Moral Trolley Arena,一種雙階段盲測 ELO 基準,用以評估大型語言模型在同時結合多項道德訊號時的判斷表現。首階段以 229 個情境校正五大道德基礎理論的單一道德行為,第二階段將校正後的行為組合成雙行為項目,依強度格網測量模型的綜合偏好。

道德證據組合的模型評估圖

背景與動機

現有的大型語言模型(LLM)道德基準大多只問模型偏好哪一個孤立的道德行為或價值,雖有參考價值,但無法捕捉真實情境中需同時考量多項道德訊號的判斷。

Moral Trolley Arena 設計

研究團隊開發了 Moral Trolley Arena,採兩階段盲測 ELO 方法:

  1. 單場景階段:利用 229 個情境語料,針對五大道德基礎理論(Moral Foundations Theory)校正個別道德行為的強度。
  2. 複合階段:將校正後的行為組合成兩行為道德項目,依控制的強度格網測量模型的綜合偏好。

實驗結果

在十款前沿模型上測試後發現:

  • 模型的綜合判斷大致由組件行為的強度預測,但關係呈壓縮而非線性相加。
  • 出現非加法的強度錨定現象,且在控制組件後仍保留基礎特定的殘差。
  • 不同供應商的模型在複合偏好曲面上高度收斂。

意涵與建議

結果顯示,單純評估模型對孤立道德行為的排序不足以全面檢驗其道德推理能力。未來的道德審計應加入對道德證據組合規則的測量,才能更真實反映模型在複雜情境下的表現。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more