深度分析
DOG‑DPO:以幾何覆蓋提升 LLM 安全對齊的資料選取框架
隨著大型語言模型安全對齊需求提升,傳統偏好資料選取成本高且冗餘。研究提出DOG‑DPO,將偏好對視為表示空間中的方向向量,分解為全域錨子與資料集特定殘差子空間,並以行列式多樣性指標最大化幾何覆蓋。實驗顯示僅使用約11%偏好對,即可在六項安全基準上維持與全資料相近的效能,且選取速度提升超過15倍。
深度分析
隨著大型語言模型安全對齊需求提升,傳統偏好資料選取成本高且冗餘。研究提出DOG‑DPO,將偏好對視為表示空間中的方向向量,分解為全域錨子與資料集特定殘差子空間,並以行列式多樣性指標最大化幾何覆蓋。實驗顯示僅使用約11%偏好對,即可在六項安全基準上維持與全資料相近的效能,且選取速度提升超過15倍。
深度分析
本研究針對大型語言模型在全球部署下的安全與公平問題提出因果稽核框架。論文使用機率圖模型與Pearl的do操作消除議題毒性干擾,以反門徑校正分離情境毒性,量化介入後的人口群體拒絕率。實驗涵蓋七款指令型模型與ToxiGen及BOLD,結果顯示觀察性偏差常被高估。