深度分析 大型語言模型基準測試盲點:以因果推斷競賽揭露 ChatGPT 5.2 與人類專家表現差距 隨著大型語言模型被宣稱可媲美人類專家,研究以2016年因果推斷競賽為測試平台,發現模型在程式碼表現與誤差幅度上遠不及人類,突顯基準污染與變異性問題。研究比較了20個ChatGPT Codex 5.2產出的腳本,其中超過半數無法正確執行,且錯誤幅度高達千億標準差,遠落後於人類專家。