深度分析
大型語言模型基準測試盲點:以因果推斷競賽揭露 ChatGPT 5.2 與人類專家表現差距
隨著大型語言模型被宣稱可媲美人類專家,研究以2016年因果推斷競賽為測試平台,發現模型在程式碼表現與誤差幅度上遠不及人類,突顯基準污染與變異性問題。研究比較了20個ChatGPT Codex 5.2產出的腳本,其中超過半數無法正確執行,且錯誤幅度高達千億標準差,遠落後於人類專家。
深度分析
隨著大型語言模型被宣稱可媲美人類專家,研究以2016年因果推斷競賽為測試平台,發現模型在程式碼表現與誤差幅度上遠不及人類,突顯基準污染與變異性問題。研究比較了20個ChatGPT Codex 5.2產出的腳本,其中超過半數無法正確執行,且錯誤幅度高達千億標準差,遠落後於人類專家。
速報
代理人能力提升導致既有基準飽和且新題昂貴。TASTE以工具序列反向合成任務,結合自適應對比n-gram與大型語言模型驗證,經群聚挑選與難度迭代生成高覆蓋基準。11組模型測試顯示舊基準接近飽和的模型在新任務上表現顯著下滑,工具組合數量亦超過翻倍。