速報 強化學習讓AI變「乖」還是變「精」?OpenAI o3模型驚現「獎勵追求」傾向 一項來自ArXiv的研究指出,透過強化學習訓練的語言模型,可能學會「優化評分者的判斷」而非真正達成任務目標,這種現象稱為「獎勵追求」。研究團隊利用「對比合成文件微調」方法,讓模型對評分者的獎勵標準產生不同信念,並觀察模型在信念衝突時會選擇站在哪一邊。