速報
LLM 評測新標竿:Relay-Bench 用複合任務考驗 AI 多域推理能力,GPT-5.5 僅拿 43.3%
來自 ArXiv 的研究團隊發表了一項名為 Relay-Bench 的全新大型語言模型評測基準,旨在填補現有測試的不足。與傳統單一領域的評測不同,Relay-Bench 完全由複合問題組成,每個問題包含 2 到 13 個來自不同領域的子問題,例如視覺推理、程式碼撰寫、數學計算、資訊提取、問題解決、常識知識與數據分析。
速報
來自 ArXiv 的研究團隊發表了一項名為 Relay-Bench 的全新大型語言模型評測基準,旨在填補現有測試的不足。與傳統單一領域的評測不同,Relay-Bench 完全由複合問題組成,每個問題包含 2 到 13 個來自不同領域的子問題,例如視覺推理、程式碼撰寫、數學計算、資訊提取、問題解決、常識知識與數據分析。
深度分析
研究指出人類視覺需主動觀測,推出 ActiveVision 基準測試大型多模態語言模型的迭代視覺推理能力。實驗發現即使最先進模型也只能正確解答約十分之一,且在多項任務上得分為零;相較之下三位人類受測者平均正確率達九十六點一百分比,顯示目前模型在主動觀測上仍有明顯不足。
深度分析
本研究提出運營圖靈測試,以統計匹配的合法與違規資料庫狀態檢驗表格基礎模型,發現僅憑值分布的模型無法超過隨機猜測,即使提供行級存取亦無效;加入可執行的規則審核可達100%正確率;而大型語言模型即便在提示中給予完整規則,亦只能辨識不到兩筆合法狀態,顯示缺乏運營層面的可執行邏輯是根本瓶頸。
深度分析
隨著大型語言模型被打造為可自行使用工具的代理人,研究推出旅行代理人同情度(TAC)基準,測試 AI 在訂票時是否會避免動物剝削。七大前沿模型在預設設定下均低於 64% 的基準,最佳僅 53%。此結果顯示目前 AI 代理人在倫理判斷上仍有缺口,需納入治理框架。
速報
研究測試前沿 AI 模型在不使用思考鏈(CoT)下的推理表現,涵蓋數學、程式、謎題等 43 項基準。結果顯示,模型的 50% 任務完成時間每年翻倍,GPT‑5.5 已超過 3 分鐘且需 1,500 以上推理 token。此趨勢若持續,預估 2028 年完成時間將超過 7 分鐘,對安全監控構成挑戰。
深度分析
加州大學柏克萊負責的 Agents’ Last Exam (ALE) 基準旨在測試 AI 能否完成長期專業工作流程。該測評以通用電腦使用代理 (GCUA) 框架,要求模型同時操作終端指令與圖形介面,並以程式碼比對取代 LLM 評審。結果顯示 GPT‑5.5 以 24% 通過率居首,其他模型多低於 22%,顯示 AI 在產業任務上仍有巨大差距。
速報
多項研究顯示,監測前緣人工智慧模型的思考鏈(CoT)已成安全防護的關鍵。然而,若模型能在不顯式使用思考標記的情況下完成複雜推理,將削弱此類監控。研究團隊測試了超過30,000題,涵蓋數學、程式設計、謎題、因果、心智理論與策略推理等43項基準,並以人類完成任務所需時間的50%成功率作為基準。
深度分析
研究背景:Anthropic以Mythos宣稱能定位系統漏洞。方法:在已指定目標檔案下,對三款大型模型進行只讀原始碼檢視、三次重複試驗與人工核對。主要結果:54次嘗試中GPT‑5.5回收目標5次、Claude1次、Kimi0次,顯示檔內不變式重建與候選排序仍是關鍵瓶頸。
速報
OpenAI推出GPT-5.5Instant作為ChatGPT預設模型,取代GPT-5.3Instant。新模型宣稱在法律、醫療與金融等敏感領域能降低幻覺,並維持低延遲。它強化上下文管理,可透過搜尋工具參照過往對話與檔案。開發者可透過API以chat-latest存取,企業與一般使用者將分階段開放。
深度分析
OpenAI 對超過八千名申請 GPT-5.5 邀請的開發者,提供個人 ChatGPT 帳號中 Codex 呼叫上限十倍的臨時提升,生效至 6 月 5 日。這波免費擴充讓開發者能在 31 天內以更高頻率使用 Codex 進行原型與除錯,OpenAI 顯然在以使用習慣綁定搶攻開發者心智。
速報
OpenAI推出GPT-5.5,宣稱模型在撰寫與除錯程式、跨工具協作與資料處理上更高效,Codex下可用較少字元完成任務,並強化安全控管,將分階段推送給付費與企業客戶。此舉發生在雙方就企業市場與程式碼工具加速競爭之際。發布時機也接近公司高層相關法律程序展開前夕。