深度分析
Travel Agent Compassion (TAC) 基準揭示大型語言模型在 AI 旅行代理人中的動物福利缺口
研究指出,隨著大型語言模型被當作自動旅行代理人,需評估其對動物福利的隱性偏好。研究團隊提出首個代理人基準 TAC,透過十二組旅遊情境測試七大前沿模型。結果顯示所有模型在預設設定下均低於 64% 基準,最佳僅 53%。加入關懷指示可提升部分模型表現 47 至 63 個百分點,研究呼籲將此類評測納入歐盟 AI 治理框架。
深度分析
研究指出,隨著大型語言模型被當作自動旅行代理人,需評估其對動物福利的隱性偏好。研究團隊提出首個代理人基準 TAC,透過十二組旅遊情境測試七大前沿模型。結果顯示所有模型在預設設定下均低於 64% 基準,最佳僅 53%。加入關懷指示可提升部分模型表現 47 至 63 個百分點,研究呼籲將此類評測納入歐盟 AI 治理框架。
深度分析
隨著大型語言模型被打造為可自行使用工具的代理人,研究推出旅行代理人同情度(TAC)基準,測試 AI 在訂票時是否會避免動物剝削。七大前沿模型在預設設定下均低於 64% 的基準,最佳僅 53%。此結果顯示目前 AI 代理人在倫理判斷上仍有缺口,需納入治理框架。