內部表徵探測提升大型語言模型預測校準與可信度
研究針對大型語言模型的預測校準與推理可信度進行探討。透過在中間層激活上訓練表徵池化探測器,顯著提升模型校準度,且能偵測出鏈式思考與實際證據不符的情況。實驗顯示,預測在推理前已基本確定,使用此方法可減少產生代幣量 30%~47% 且不影響準確性。
大型語言模型(LLM)即使在經過預測微調後仍常出現校準不足的問題,且其鏈式思考(CoT)推理不一定能真實反映預測背後的證據。研究團隊以 Eternis-Forecaster 8B 在 OpenForesight 平台上的表現為切入點,訓練了針對中間層激活的表徵池化探測器(representation-pooling probes),結果顯示校準度顯著提升。
跨模型驗證
相同的探測方法亦在 GLM-4.7-Flash 與 GLM-4.5-Air 兩款模型上取得類似成效,證明此技巧具備一定的通用性。
證據剝除與干擾測試
研究者透過移除提示中具影響力的資訊來源,觀察模型預測是否改變,同時檢視 CoT 文字是否保持不變。結果發現,模型往往會改變預測卻未在推理文字中顯示相應變化,顯示 CoT 可信度不足。
探測器作為「說謊偵測器」
探測器的激活能比 CoT 文字更好地捕捉行為變化,且在 84% 的案例中正確預測結果變化方向,即使 CoT 隱藏了干擾的影響。
預測在推理前已確定
研究進一步證實,單次在推理前的預測通過即可恢復模型的答案與信心分布,說明答案在推理開始前已基本固定。利用此預測分布的散布度來分流問題,可節省 30%~47% 的產生代幣,且不影響預測準確度。
綜合以上結果,內部表徵探測被證實為校準、稽核與篩選語言模型預測與推理的實用工具,為未來提升 LLM 預測可靠性提供了新方向。
延伸閱讀
- MORPHOGEN:以 GENFORM 衡量多語言大型模型的語法性別形態能力
- 以大型語言模型評估醫療回應完整性:方法、失敗模式與臨床限制
- WorldDB:以遞歸向量圖譜與內容可尋址結構建構長期代理記憶引擎
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。