深度分析
「evalci」:Python 套件提供語言模型評估的統計信賴區間與顯著性檢定
在語言模型評估常只報單一準確度時,evalci 提供統計信賴區間、配對顯著性測試與多重比較校正,讓結果具可驗證性。實驗顯示,原先排行榜上 8 個相鄰差距中有 3 其實不顯著。此工具僅依賴 numpy、scipy、pandas,安裝簡便,且與 lm-evaluation-harness、HELM 輸出直接對接。
深度分析
在語言模型評估常只報單一準確度時,evalci 提供統計信賴區間、配對顯著性測試與多重比較校正,讓結果具可驗證性。實驗顯示,原先排行榜上 8 個相鄰差距中有 3 其實不顯著。此工具僅依賴 numpy、scipy、pandas,安裝簡便,且與 lm-evaluation-harness、HELM 輸出直接對接。
深度分析
隨著大型語言模型被廣泛用於文字分類,研究指出傳統信賴區間在小樣本或高精度情況下常失準。作者比較 Wald、Wilson、Agresti‑Coull 等解析法與層級抽樣、偽計數自助法,發現後者在覆蓋率與區間寬度上更可靠,特別是處理同一作者多篇文本的階層結構。此發現提升模型透明度與結果可信度。