Office Comprehension Bench:首個同時評測 Word、Excel、PowerPoint 的大型語言模型基準
研究團隊推出首個同時評測 Word、Excel、PowerPoint 的基準 OCB,分為結構視覺測試與跨領域專業問答兩條軌道。測試以原子化判斷方式由多個 LLM 評審打分,最先進系統在專業問答上僅達 59.3% 左右,提升深度效益有限,升級產品等級才有小幅提升。
OCB 目標與架構
Office Comprehension Bench(OCB)是首個公開基準,旨在同時評估大型語言模型(LLM)對 Microsoft Office 三大核心檔案格式(.docx、.xlsx、.pptx)的理解能力。基準分為兩條軌道:
- File Fidelity Q&A:測試模型對表格、圖表、嵌入圖片、公式、頁首、投影片備註、命名範圍等結構與視覺元素的感知。
- Domain Q&A:使用來自 12 個專業領域的真實產業文件,要求模型進行多步驟分析與跨文件綜合推理。
評分機制
每個參考答案會被拆解成原子化、二元可判斷的敘述。多個 LLM 評審(judge)會針對每一敘述獨立打分,最終以加權方式彙總為模型的總分。
實驗結果
即使是目前最先進的前沿系統,在預設推理模式下的 Domain Q&A 成績僅約 59.3%。提升模型的思考深度(如增加迭代次數)對成績提升有限,只有升級至更高產品等級時才會看到 modest 的進步。
開源資源
研究團隊同步釋出完整資料集、評估工具、評審提示(judge prompt)以及公開排行榜,鼓勵社群持續改善模型在辦公軟體理解上的表現。
延伸閱讀
- InKH 架構降低延遲與代幣負載,強化金融 AI 代理的記憶管理
- 人工智慧採用的Alpha衰竭:AI驅動的信號衰減與市場脆弱性分析
- FinCAD:上下文感知解碼抑制(CAD)以減除大型語言模型的參數前瞻偏差於金融回測
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。