ARC-AGI-3 代理歸因研究:完整驗證變體全面解題,但可能僅飽和公開集

一項針對 ARC-AGI-3 代理的歸因研究,設計四種巢狀 Codex 變體進行比較。結果顯示完整驗證變體在四組設定中皆排名第一,但資源消耗較高;後續以 gpt-5.6-sol 測試時,該變體完全解完所有公開遊戲,RHAE 約 99%,動作數不到人類基線一半,但可能僅代表公開集飽和。

ARC-AGI-3驗證變體結構

一項針對 ARC-AGI-3 代理的歸因研究,揭露了不同設計元件對效能的實際貢獻。研究團隊設計四種巢狀 Codex 代理變體,從純文字基線到具備排程簡化與完整驗證的固定介面版本,並在 gpt-5.4 與 gpt-5.5 模型上以高與極高推理努力進行測試。

主要發現

最穩健的結果是:每個代理變體都隨著更強的模型與更高的推理努力而進步。但在同一模型與推理努力設定下,變體間的效能差異比預期小,且個別元件的效果會因設定而異。例如,要求持續提供可執行交付物並非普遍有利:在 gpt-5.5 的兩種設定中,純文字變體反而勝過彈性介面可執行變體。

排程簡化在四組模型-努力設定中有三組提升效能,僅在 weakest 設定中例外。完整驗證變體(保留簡化且要求精確重現觀測記錄)在所有四組設定中排名第一,但資源消耗明顯更高。

後續測試

在後續的 gpt-5.6-sol 測試中,驗證變體在兩種推理努力下完全解決了所有公開遊戲,達到約 99% 的 RHAE,且總動作數不到人類基線的一半。然而,由於該模型發布時間晚於這些遊戲,且未測試未公開資料,此結果應解讀為僅是公開集的飽和現象。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more