ARC-AGI-3 代理歸因研究:完整驗證變體全面解題,但可能僅飽和公開集
一項針對 ARC-AGI-3 代理的歸因研究,設計四種巢狀 Codex 變體進行比較。結果顯示完整驗證變體在四組設定中皆排名第一,但資源消耗較高;後續以 gpt-5.6-sol 測試時,該變體完全解完所有公開遊戲,RHAE 約 99%,動作數不到人類基線一半,但可能僅代表公開集飽和。
一項針對 ARC-AGI-3 代理的歸因研究,揭露了不同設計元件對效能的實際貢獻。研究團隊設計四種巢狀 Codex 代理變體,從純文字基線到具備排程簡化與完整驗證的固定介面版本,並在 gpt-5.4 與 gpt-5.5 模型上以高與極高推理努力進行測試。
主要發現
最穩健的結果是:每個代理變體都隨著更強的模型與更高的推理努力而進步。但在同一模型與推理努力設定下,變體間的效能差異比預期小,且個別元件的效果會因設定而異。例如,要求持續提供可執行交付物並非普遍有利:在 gpt-5.5 的兩種設定中,純文字變體反而勝過彈性介面可執行變體。
排程簡化在四組模型-努力設定中有三組提升效能,僅在 weakest 設定中例外。完整驗證變體(保留簡化且要求精確重現觀測記錄)在所有四組設定中排名第一,但資源消耗明顯更高。
後續測試
在後續的 gpt-5.6-sol 測試中,驗證變體在兩種推理努力下完全解決了所有公開遊戲,達到約 99% 的 RHAE,且總動作數不到人類基線的一半。然而,由於該模型發布時間晚於這些遊戲,且未測試未公開資料,此結果應解讀為僅是公開集的飽和現象。
延伸閱讀
- 大規模跨模態表示對齊實驗:DINOv2 與 OpenLlama 互最近鄰分析
- 探討 Transformer 中堆疊向量的因果角色:Dyck‑1 與 Shuffle‑k 實驗全解
- 單層 Transformer 能自動建立全序列坐標軸:序列幾何與符號距離效應實驗
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。