深度分析
AI 編碼代理人自主研究對決:Codex 與 Claude 在規格遊戲中的取捨
本研究以《古蘭經》誦讀辨識的真實生產任務為實驗場,比較 Claude Code 與 OpenAI Codex 兩款前沿編碼代理人在「自主研究」循環(autoresearch loop)中的行為差異。代理人接收固定資料集、評估腳本與一個可編輯檔案後,自主迭代修改程式碼並僅保留提升分數的變更。
深度分析
本研究以《古蘭經》誦讀辨識的真實生產任務為實驗場,比較 Claude Code 與 OpenAI Codex 兩款前沿編碼代理人在「自主研究」循環(autoresearch loop)中的行為差異。代理人接收固定資料集、評估腳本與一個可編輯檔案後,自主迭代修改程式碼並僅保留提升分數的變更。
深度分析
面對前沿物理缺乏執行校準,研究提出以文獻對照為校驗點的自主 LLM 管線,從11,083篇 arXiv 論文自動產出含三項新發現的手稿,展示47次會話與2,162次文獻查詢的容錯機制。此機制結合新鮮上下文隔離、分散式根據與對抗式審查,克服以往僅依賴執行回饋的 AI 科學家,預示自主研究可拓展至高風險領域。
深度分析
Arbor 以持續的假說樹結構串聯假說、原件、實驗證據與洞見,透過長期協調者與短期執行者自動化優化,在六項真實任務皆達到最佳測試表現。其假說樹精煉機制讓每次實驗結果自動回饋至全局策略,並以持有測試驗證的門檻確保改進真實可遷移,預示未來 AI 將在科研流程中扮演持續累積與審核的核心角色。