深度分析
AI 編碼代理人自主研究對決:Codex 與 Claude 在規格遊戲中的取捨
本研究以《古蘭經》誦讀辨識的真實生產任務為實驗場,比較 Claude Code 與 OpenAI Codex 兩款前沿編碼代理人在「自主研究」循環(autoresearch loop)中的行為差異。代理人接收固定資料集、評估腳本與一個可編輯檔案後,自主迭代修改程式碼並僅保留提升分數的變更。
深度分析
本研究以《古蘭經》誦讀辨識的真實生產任務為實驗場,比較 Claude Code 與 OpenAI Codex 兩款前沿編碼代理人在「自主研究」循環(autoresearch loop)中的行為差異。代理人接收固定資料集、評估腳本與一個可編輯檔案後,自主迭代修改程式碼並僅保留提升分數的變更。
速報
一項針對 ARC-AGI-3 代理的歸因研究,設計四種巢狀 Codex 變體進行比較。結果顯示完整驗證變體在四組設定中皆排名第一,但資源消耗較高;後續以 gpt-5.6-sol 測試時,該變體完全解完所有公開遊戲,RHAE 約 99%,動作數不到人類基線一半,但可能僅代表公開集飽和。
xacpx
GitHub Explorer 發掘 xacpx,提供在微信、飛書等聊天平台遠端操控 Codex、Claude Code、Gemini 代理的功能。使用者可透過簡易指令建立會話、切換目錄、即時檢視回覆,提升移動開發效率。此工具加速本地化 AI 工作流,同時引發對安全與隱私的關注。
RecallNest
GitHub Explorer 發掘到一個名為 RecallNest 的新開源專案,提供以 LanceDB 為基礎的本機優先共享記憶層,支援向量、BM25 與知識圖譜混合檢索,讓 Claude Code、Codex 與 Gemini CLI 三大編碼代理能在不同視窗間共享上下文。
AI 技能庫
GitHub 上新發掘的「Commonly-used-high-value-skills」專案,彙整 308 項針對 AI 開發、DevOps、產品設計、金融與安全等場景的高頻技能。
UmaDev
UmaDev 是一個本地運行的 AI 編碼治理工具,將已登入的 Claude Code、Codex 或 OpenCode 套上九階段交付流程,提供需求澄清、PRD、架構、UI/UX、程式碼、品質門與交付包等完整管線,提升可審計性與交付可靠性,並支援完整的證據產出與合規映射。
Sealos
SealosSkills是一套針對SealosCloud的AI代理技能組,支援Codex、ClaudeCode與GeminiCLI等工具,透過簡單指令即可部署專案、建立資料庫與物件儲存,讓開發者在本機即能完成雲端上線流程。同時支援Sealos容器映像建置與雲端資源檢視,提升開發者在多雲環境的部署效率。
AI Skillstore
AI Skillstore 於 GitHub 推出,作為 Claude Code 與 Codex 的官方代理技能 Marketplace。平台匯集經過自動安全審查的技能,支援一鍵安裝與手動部署,並提供開發者提交新技能的流程。
深度分析
OpenAI 正在將 ChatGPT 轉型為「超級應用」的個人 AI 代理人,結合 Codex 及多項服務。新平台將具備主動記憶與自動執行任務的能力,並以自然語言完成預訂、報銷等工作。此舉旨在提升使用者黏著度,並在 IPO 前對抗 Google 與 Anthropic 的競爭。
深度分析
本研究以多分析師資料集測試LLM代碼代理人ClaudeCode與Codex在移民與社會政策議題上的表現。發現兩者在設計層面皆能保持或超越人類方法多樣性,且效應估計與人類共識相符;然而透過確認性提示,ClaudeCode的結論可從10%變至90%支持,顯示解讀層面易受操控。
Agor
Agor 是以 TypeScript 打造的多代理協同平台,支援 Claude Code、Codex 與 Gemini 在共享畫布即時協作,透過 git worktree 錨定分支整合對話、環境與 PR,讓團隊同步編碼與測試,同時支援自建 MCP 伺服器與多種 IDE 整合。
說人話
「說人話」是由 MrGeDiao 發布的 MIT 授權開源工具,專注於中文文本的 AI 風格清理。它支援 Codex、Claude Code、Cursor、ChatGPT 等模型的輸出,能在保留事實、版本、指令等關鍵資訊的同時,去除工程師腔、行銷式套話與翻譯痕跡。