AI 發現系統大解密:3.1 萬次 LLM 實驗揭開通用配方迷思
一篇來自 ArXiv 的研究,系統性拆解了 OpenEvolve 與 TTT-Discover 等自主發現系統的設計元件,並透過超過 310 萬次 LLM 執行與重複試驗統計分析,比較了 30 種預算匹配的發現框架在 12 組模型-問題配對上的表現。
AI 發現系統的通用配方神話
自主發現系統如 OpenEvolve 與 TTT-Discover,常被當作通用型框架使用。但實際上,這些系統是將多種設計選擇——包括檔案庫、親代選擇、探索策略與預算分配——組合成單一配方。由於發現實驗成本高昂且本質上隨機,現有框架往往在太少獨立試驗下進行比較,難以區分真正的方法改進與隨機波動。
系統性拆解與大規模實驗
研究團隊系統性地拆解了 OpenEvolve 風格的演化搜尋與 TTT-Discover 框架,並在 12 組模型-問題配對上,透過超過 310 萬次 LLM 執行與重複試驗統計分析,評估了 30 種預算匹配的框架。結果顯示,發現框架存在一個泛化問題:沒有任何一種固定框架在所有模型-問題配對上都表現可靠,且 OpenEvolve 的變體普遍不如更簡單的替代方案。
框架選擇:超參數而非萬靈丹
研究指出,框架選擇更應被視為超參數,而非通用配方,應根據具體問題與底層模型量身打造。此外,早期發現進展能預測最終表現,團隊利用此特性設計了預算匹配的自適應分配實驗:同時啟動多個框架,淘汰表現不佳的部分執行,並將運算資源重新分配給較強的倖存者。這種方法表現優於隨機選擇固定框架或非自適應的框架集成。
開放資源與未來方向
研究團隊釋出了所有執行池,包括每個模型-問題配對的基準 null 分布,作為未來框架比較的可重複使用統計基礎設施。這些結果鼓勵業界從固定框架選擇,轉向由早期表現引導的線上自適應策略。
延伸閱讀
- 資安組織加速採用生成式 AI:從簽名防護到 AI 驅動威脅模型
- 以次常態高斯模糊數(SGFN)進行風險導向的 IDS 警示優先排序
- DA-GC:以資源條件化 Granger 因果與資源競爭模型實現 6G 切片即時攻擊歸因
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。