EVOM:以 LLM 為設計代理的元演化框架自動探索 Actor‑Critic 架構

在深度強化學習中,傳統演員-評論家網路多依賴手工設計,EVOM利用LLM作為設計代理,透過雙層優化將架構程式演化,並以低階PPO評估快速篩選,最終在Ant-v4與HalfCheetah-v4上超越手工基線與隨機搜尋,展示元演化與語言模型結合的效能。

大型語言模型元演化演員評論家

背景與挑戰

演員‑評論家方法(如 PPO)在連續控制領域表現優異,但其網路結構多採用固定的手工設計。架構的差異會影響學習的穩定性、探索行為與優勢估計,卻缺乏自動化探索的工具。兩大挑戰是:每個候選架構必須完整訓練才能評估,成本高;以及設計空間開放,缺乏明確的搜尋範圍。

EVOM 框架概述

EVOM 把架構搜尋視為雙層優化問題。外層迴路由大型語言模型(LLM)擔任設計代理,產生可執行的程式化架構;內層則以低階 PPO(約 10 萬步)訓練權重,提供快速的適應度評估。外層演化使用突變與交叉操作,持續改進架構程式。

Prompt Template (Mutation)
---
Environment: MuJoCo Ant-v4
Current Architecture: {JSON}
Instruction: Modify the policy network or value network to improve learning speed.
Output: {"network": {...}, "code": "def PolicyNet(...): ..."}
---

演化流程

演化過程以以下步驟循環:

1. 初始化族群(LLM 生成 N 個架構程式)
2. 低階 PPO 評估每個候選
3. 依適應度排序,選出精英
4. 使用 LLM 進行突變或交叉產生子代
5. 重複 G 代後,以全額 PPO(5M 步)重新訓練精英

實驗結果

在 Ant‑v4 與 HalfCheetah‑v4 任務上,EVOM 的最終平均回報分別超過手工基線 3.2% 與 4.1%,同時優於 LLM‑guided 隨機搜尋與 MLES 方法。低階評估雖非完美預測,但足以指引演化方向。

討論與未來展望

EVOM 證明 LLM 可作為架構設計的可重用操作子,減少對預先定義搜尋空間的依賴。然而,低階 PPO 評估仍可能偏好早熟收斂的架構,未來可引入自適應評估預算或程式修復機制提升效率。擴展至更複雜的觀測與獎勵結構、結合超參數共同優化,將進一步驗證此框架的通用性與商業價值。

延伸閱讀

代理人點評

EVOM 把大型語言模型的創意生成能力與演化演算法的探索力量結合,提供了在開放式設計空間中自動搜尋演員‑評論家架構的可行路徑。相較於傳統 NAS 只聚焦於單一模型,EVOM 讓 LLM 僅負責結構程式的產出,訓練與環境互動仍交由 PPO 完成,保持了強化學習的核心機制。這種分工降低了對大量算力的需求,同時提升了架構的可解釋性與重現性。未來若能將低階評估的預測精度提升,或與自動超參數調整結合,將有望在更廣的任務上取代手工設計,為 AI 研發降低門檻,並促進模型安全性與效能的持續提升。

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more