AI 搜尋代理也能自我進化!Dr. Zero 框架問世,不靠人工資料也能變強
高品質資料日益稀缺,自我進化成AI新解。Dr. Zero框架讓搜尋代理僅靠外部搜尋引擎就能自主進化,透過提問者與解題者的反饋迴路自動生成越來越難的問題。Hop-grouped相對策略最佳化大幅降低運算成本,在多項基準測試中表現不輸監督式模型。
AI 搜尋代理的自我進化新路徑
隨著高品質訓練資料越來越難取得,無需人工標註資料的自我進化(self-evolution)逐漸成為大型語言模型(LLM)領域的重要研究方向。然而,多輪搜尋代理(multi-turn search agent)在這方面一直面臨瓶頸,主要原因是問題多樣性不足,以及多步驟推理與工具使用所需的運算資源過於龐大。
Dr. Zero 框架:提問者與解題者的協作迴路
為了解決這個問題,研究團隊提出了 Dr. Zero 框架。這個框架的核心是一個自我進化的反饋迴路:一個「提問者(proposer)」生成結構多樣化的問題,訓練一個從相同基礎模型初始化的「解題者(solver)」。隨著解題者能力提升,提問者會被激勵去產出更困難但可解的問題,形成自動化的課程機制,讓兩個代理持續進步。
HRPO 最佳化:降低運算成本
為了提升訓練效率,團隊還設計了 hop-grouped relative policy optimization(HRPO)方法。這個方法將結構相似的問題分組,建立群組基準線,有效降低評估每個問題難度與可解性所需的取樣成本。HRPO 大幅減少提問者訓練與獎勵估計所需的運算資源,同時不影響效能或穩定性。
實驗結果:自我進化可匹敵監督式學習
廣泛的實驗結果顯示,Dr. Zero 在多個問答基準測試中,表現可與完全監督式訓練的搜尋代理匹敵甚至超越。這證明強大的代理搜尋與證據推理能力,可以僅透過自我進化產生,無需依賴人工標註的訓練資料。
延伸閱讀
- LLM精神病理:揭露大型語言模型的五種認知崩解
- 大型語言模型文化偏誤審計:GPT-5.4、Claude Sonnet 4.5、Gemini 2.5 Flash 的個體主義傾向分析
- 大型自律代理人社會的集體智慧:以 MoltBook 和 Probing Agents 的三級檢測框架驗證
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。