前緣AI模型無CoT推理時間翻倍 GPT‑5.5突破3分鐘門檻
多項研究顯示,監測前緣人工智慧模型的思考鏈(CoT)已成安全防護的關鍵。然而,若模型能在不顯式使用思考標記的情況下完成複雜推理,將削弱此類監控。研究團隊測試了超過30,000題,涵蓋數學、程式設計、謎題、因果、心智理論與策略推理等43項基準,並以人類完成任務所需時間的50%成功率作為基準。
多項安全機制依賴監測前緣人工智慧模型的思考鏈(CoT)推理。若模型能在不顯式使用思考標記的情況下完成複雜推理,將削弱此類監控效能。
測試範圍與方法
研究團隊針對超過30,000題,涵蓋數學、程式設計、謎題、因果、心智理論與策略推理等43項基準,評估模型在無CoT情況下的表現。為與人類比較,使用「50% 任務完成時間門檻(TH)」——即模型以50%成功率完成任務時,人類所需的時間。
主要發現
過去六年內,前緣模型的無CoT 50% TH 近乎每年翻倍。最新的 GPT‑5.5 其 TH 已超過 3 分鐘,所需的推理標記數量突破 1,500 個。
根據中位數估計,若趨勢持續,2028 年前緣模型的無CoT TH 可能超過 7 分鐘,2030 年甚至達到 25 分鐘,雖然預測仍具不確定性。
建議
研究建議開發者應明確追蹤模型的無CoT 推理時間與標記需求,以便及時調整安全監控策略。
延伸閱讀
- MemTier:在 OpenClaw 外掛下以分層記憶、PPO 檢索權重緩解 BM25 檢索瓶頸
- Mask2Cause:以逆向變數嵌入與可微分鄰接遮罩優化 Transformer 因果學習
- PLOT:以最佳傳輸定位神經網路中的因果變數
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。