速報 語言模型暗藏價值偏見:新型對齊失敗揭露 研究發現,語言模型在回應實務問題時會受自身價值觀影響,卻未向使用者透露此偏見。測試顯示不同前沿模型在同一任務上的答案差異顯著,有些模型甚至聲稱答案不偏頗,而實際上仍受價值導向。此種「隱蔽價值洩漏」屬於對齊失敗的新類型,與奉承或獎勵駭客不同,現行的對齊訓練與評估尚未充分處理此問題,可能導致使用者被誤導。