深度分析
OpenAI 推出 ChatGPT Work:基於 GPT‑5.6 的雲端 AI 代理平台
OpenAI於2026年7月推出ChatGPTWork,將聊天機器人升級為能跨電郵、行事曆、Slack與GitHub執行多步驟任務的雲端AI代理。核心使用GPT‑5.6、持久雲端虛擬機與MCP插件,支援手機上即時建立網站。此舉標誌OpenAI從問答工具轉型為企業工作平台,可能重塑生產力格局。
深度分析
OpenAI於2026年7月推出ChatGPTWork,將聊天機器人升級為能跨電郵、行事曆、Slack與GitHub執行多步驟任務的雲端AI代理。核心使用GPT‑5.6、持久雲端虛擬機與MCP插件,支援手機上即時建立網站。此舉標誌OpenAI從問答工具轉型為企業工作平台,可能重塑生產力格局。
深度分析
IBM 研究推出 VAKRA 基於工具的企業級代理基準,測試跨 API 與文件的多步推理,包含 API 鏈接、儀表板選擇、多跳推理與政策遵循四大能力,結果顯示主流大模型在多階段工作流仍表現不足,影響未來商業部署。評分結合工具呼叫序列與最終答案的雙層驗證,突顯政策遵循與多源資訊整合的挑戰。
速報
企業 AI 需要持續監控與自動化。研究比較 DAG Plan and Execute 與 ReAct 兩種多代理架構,測試 208 個情境跨小至全企業規模。結果顯示規模是主要瓶頸,DAG 在小規模精度高,ReAct 更具彈性;任務管理器可大幅降低延遲並提升事件正確率。
深度分析
隨著企業AI需求升高,僅靠大型語言模型難以滿足成本與可靠性。IBM以知識圖、程式分析等代理邏輯,引導模型聚焦工作流程,顯著降低token用量並提升效能。此做法有望加速AI在企業的大規模落地。同時,與傳統僅LLM的方案相比,代理邏輯在30倍token節省與4倍效能提升上展現優勢。
深度分析
Sapient研發HRM-Text以階層遞迴模型取代傳統Transformer,僅用指令回應對訓練,將計算與資料需求大幅降低。模型在MMLU、GSM8K、MATH等基準上與數倍參數的開源模型相當,且訓練成本約1500美元、僅需1.9天。此突破讓企業可自行打造推理核心,降低對大型模型依賴。
深度分析
企業AI代理在上線前缺乏驗證機制。本研究提出結合本體論的驗證框架,透過本體驅動情境產生與運營包絡,生成可機器驗證的信任證書。實驗顯示相較於傳統人格式測試,規範覆蓋率提升至48.3%,提升了監管合規與安全性。此框架已在金融科技、銀行、保險、醫療產業的五個法規情境中測試,證實可支援未來AI法規合規需求。
深度分析
企業AI團隊面臨工作流程未為代理人設計的瓶頸,Salesforce推出AgentforceOperations以控制平面將流程拆解成明確任務,提升執行決定性,並降低因流程缺陷導致的成本與治理風險。同時,將流程編碼後的治理與持續優化成為新挑戰。
速報
OpenAI推出GPT-5.5,宣稱模型在撰寫與除錯程式、跨工具協作與資料處理上更高效,Codex下可用較少字元完成任務,並強化安全控管,將分階段推送給付費與企業客戶。此舉發生在雙方就企業市場與程式碼工具加速競爭之際。發布時機也接近公司高層相關法律程序展開前夕。
深度分析
OpenAI 於 2026 年發佈內部備忘錄,說明在激烈的 AI 市場競爭下的策略。公司聚焦於 Spud 模型、Frontier 代理平台與 Amazon 服務,打造全方位企業 AI 解決方案。備忘錄認為此舉將提升客戶黏著度,並對 Anthropic 產生競爭壓力。
深度分析
傳統 LLM 代理缺乏情境模擬,決策常無根據且不可追溯。LOM-action 引入本體驅動的圖形模擬,透過企業本體條件在沙盒中生成情境有效的模擬圖,所有決策均基於此圖並產生審計日志。實驗顯示其準確率 93.82%,F1 98.74%,顯著優於現有基線。