LLM 評測新標竿:Relay-Bench 用複合任務考驗 AI 多域推理能力,GPT-5.5 僅拿 43.3%
來自 ArXiv 的研究團隊發表了一項名為 Relay-Bench 的全新大型語言模型評測基準,旨在填補現有測試的不足。與傳統單一領域的評測不同,Relay-Bench 完全由複合問題組成,每個問題包含 2 到 13 個來自不同領域的子問題,例如視覺推理、程式碼撰寫、數學計算、資訊提取、問題解決、常識知識與數據分析。
全新評測標準:Relay-Bench
大型語言模型(LLM)的評測方式又有新突破。來自 ArXiv 的研究團隊發表了一項名為 Relay-Bench 的基準測試,目標是更全面地評估 AI 在真實世界中的應用能力。這個測試的獨特之處在於,它不問單一問題,而是要求模型在一個提示中,同時處理來自多個不同領域的子問題。
複合任務設計
Relay-Bench 的測試集完全由複合問題組成。每個問題包含 2 到 13 個子問題,橫跨視覺推理、程式碼撰寫、數學計算、資訊提取(特別是網路搜尋)、問題解決、常識知識與數據分析等領域。這些子問題並非獨立存在,而是被串聯成一個連貫的挑戰,迫使模型必須在單一回應中進行跨域推理。
增加難度的干擾層
為了模擬真實世界的複雜性,研究團隊還為部分問題加入了兩層干擾:提示編碼與上下文膨脹。這意味著模型不僅要解決問題,還得從大量無關或編碼過的資訊中,準確找出關鍵線索。
開放工具使用
值得注意的是,Relay-Bench 對模型的使用方式沒有限制。模型被明確鼓勵利用執行程式碼、網路搜尋以及其他可用工具來解決問題。這項設計反映了當今 AI 應用中,模型不再只是封閉的文字處理器,而是能與外部環境互動的代理人。
結果與啟示
在目前測試的模型中,表現最佳的是 GPT-5.5(xHigh),但其分數也僅有 43.3%。這個結果顯示,即使是當今最頂尖的 LLM,在處理需要多步驟、跨領域推理的複雜任務時,仍有很大的進步空間。Relay-Bench 為 AI 發展提供了一個更嚴苛、也更貼近實際應用的評測標竿。
延伸閱讀
- InKH 架構降低延遲與代幣負載,強化金融 AI 代理的記憶管理
- 人工智慧採用的Alpha衰竭:AI驅動的信號衰減與市場脆弱性分析
- FinCAD:上下文感知解碼抑制(CAD)以減除大型語言模型的參數前瞻偏差於金融回測
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。