FindStatBench 問世:AI 組合式程式碼合成能力大考驗
研究團隊推出 FindStatBench,一個專為評估大型語言模型(LLM)在組合式程式碼合成表現的執行基準。該基準源自 FindStat 資料庫,包含 2,329 項任務,橫跨 24 個集合與 552 萬個隱藏實例,涵蓋統計合成(將物件映射至整數)與映射合成(物件對物件映射)。
FindStatBench:組合式程式碼合成的新標竿
研究團隊正式發表 FindStatBench,這是一個專為評估大型語言模型在組合式程式碼合成能力而設計的執行基準。該基準源自 FindStat 資料庫,包含 2,329 項任務,橫跨 24 個集合與 552 萬個隱藏實例,涵蓋統計合成(將物件映射至整數)與映射合成(物件對物件映射)兩大類別。
任務設計與評估方式
每項任務提供一段數學描述,以及最多五個公開的輸入輸出範例。模型必須輸出單一 Python 求解函式,過程中不得使用檢索、工具、執行回饋、投票或重新排序等輔助手段。提交的程式碼會在沙盒環境中,針對保留的組合式物件進行精確執行評分。
主要發現
研究團隊評估了 11 個系統,包含 4 個閉源商用模型與 7 個開源權重模型。結果顯示三個主要模式:首先,最強的開源與閉源系統在實例準確率上差距僅 1 個百分點,而所有系統的整合預測(oracle)以及從一個中階模型進行五次取樣,都只能帶來有限的任務準確率提升。其次,範例可能反而有害:某些經典雙射在零範例情況下完美解出,但在五個範例的提示下卻失敗。第三,部分失敗反映了輸出預算機制問題,模型的推理過程可能在產出程式碼前就耗盡了可見回應空間。
綜合觀察
整體而言,統計合成遠比映射合成容易,部分集合的準確率近乎為零,長提示會造成準確率急遽下降,而精確的符號規則歸納能力仍然相當脆弱。
延伸閱讀
- 人工智慧會議摘要評估系統:可重複、隱私保護與保留率差異揭示
- FairQE:以多代理與 LLM 在推論期校正翻譯品質估計的性別偏誤
- 以語意監督為核心的 Text-to-SQL 合成方法:SemanticAgent 架構與實驗結果
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。