AI 對齊新思路:以客觀底線取代單一人類價值觀

本研究挑戰以單一人類價值觀對齊人工智慧的傳統觀點,指出不同社會與政治立場會導致截然不同的價值取向,若以此為唯一目標可能帶來風險。作者主張,AI 應先遵守不可協商的客觀底線——包括能力、事實正確性、誠實與合法性——再在語言、語調與合法價值交換層面容納多元觀點。

人工智慧對齊客觀底線

研究背景

目前 AI 對齊多以「聚合人類偏好」為目標,但實務上可訓練出符合矽谷樂觀主義者、去成長環保主義者、國家保守文化戰士、單黨體制官員或虔誠宗教傳統主義者等截然不同的價值觀。

核心論點

作者認為,將 AI 對齊於單一「人類」價值是錯誤的方向。人類價值本身會塑造社會的成功或失敗,從失敗國家、極端不平等、幸福感下降、政治兩極化到富裕民主國家的政府功能失靈皆是例證。

因此,對齊計畫應先確立一套不可協商的客觀底線,包含:

  • 能力(competence)
  • 事實正確性(factual accuracy)
  • 誠實(honesty)
  • 合法性(lawfulness)

多元性只應體現在語言、語調、慣例與合法的價值權衡上,不能觸及違背底線的價值層面。

具體承諾與回應

作者提出四項建設性承諾,並針對六項常見質疑作出回應,分別是商業壓力與實務可行性、民主正當性、法規遵循、過度依賴制度論解釋、底線本身的文化負載,以及一致外推意願(Coherent Extrapolated Volition)的限制。

結論

以客觀底線為核心的對齊方式,可在保留多元表達的同時,降低 AI 產生偏頗或危害的風險,為未來 AI 安全治理提供更實務且可操作的路徑。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more