深度分析
「evalci」:Python 套件提供語言模型評估的統計信賴區間與顯著性檢定
在語言模型評估常只報單一準確度時,evalci 提供統計信賴區間、配對顯著性測試與多重比較校正,讓結果具可驗證性。實驗顯示,原先排行榜上 8 個相鄰差距中有 3 其實不顯著。此工具僅依賴 numpy、scipy、pandas,安裝簡便,且與 lm-evaluation-harness、HELM 輸出直接對接。
深度分析
在語言模型評估常只報單一準確度時,evalci 提供統計信賴區間、配對顯著性測試與多重比較校正,讓結果具可驗證性。實驗顯示,原先排行榜上 8 個相鄰差距中有 3 其實不顯著。此工具僅依賴 numpy、scipy、pandas,安裝簡便,且與 lm-evaluation-harness、HELM 輸出直接對接。
深度分析
為避免訓練資料背誦掩蓋推理能力,研究提出 GSM-SEM,一套保留原始答案但改寫語意情境的隨機化增強框架,可每次產生新題並經人類驗證。評估 14 款 SOTA 模型顯示語義變體普遍導致表現下降,最嚴格設定下平均掉落約 28%,突顯語義遷移仍是關鍵挑戰。