INFUSER:自我演化的迭代共訓練框架提升大型語言模型推理能力

研究提出 INFUSER,一種結合生成器與求解器的迭代共訓練機制,讓預訓練語言模型在僅需最小外部監督下自行提升推理表現。生成器從自動收集的非結構化文件中草擬問題與參考答案,求解器則以標準正確性獎勵訓練,生成器則根據能否提升求解器的影響分數獲得獎勵。

迭代共訓練提升推理模型

研究動機與挑戰

自我演化被視為提升語言模型推理能力的可擴展路徑,但既有方法或依賴大量人工整理的訓練資料,或在無監督生成時以難度啟發式獎勵,卻未必能真正提升求解器。

INFUSER 框架概述

INFUSER 採用迭代共訓練,包含兩個共同演化的角色:

  • 生成器(Generator):從自動收集的非結構化文件池中草擬問題與參考的黃金答案。
  • 求解器(Solver):以標準的正確性獎勵,針對生成器提供的答案進行訓練。

生成器的獎勵來源於一個稱為「影響分數」的優化器感知指標,衡量每個提問是否真的能在目標分布上提升求解器的表現。

DuGRPO:針對噪聲影響分數的優化器

由於影響分數連續且噪聲較大,傳統的 GRPO 失效。作者提出 DuGRPO,採雙正規化的變體,以更穩定地訓練生成器。

實驗與成果

在 Qwen3-8B-Base 模型上,INFUSER 在 Olympiad 與 SuperGPQA 基準上相較於強勁的自我演化基線取得超過 20% 的相對提升。8 億參數的共演化生成器在數學與程式碼任務上甚至優於凍結的 32 億參數思考生成器。消融實驗證實每項設計皆為必要,且將 INFUSER 套用於指令微調的錨模型或加入可驗證規則的 RLVR 資料,皆展現出框架的彈性與通用性。

結論與未來展望

INFUSER 成功將文件池轉化為自適應課程,讓問題的實用性優於單純的難度,為語言模型的自我演化提供了一條更有效的路徑。相關程式碼已於 GitHub 公開。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more