文言文 AI 模型揭露「我不知道」的困境:語言模型學不會表達不確定性
研究團隊從零訓練了一個 3.18 億參數的 Transformer 語言模型,使用純文言文語料庫(15.6 億 token,不含任何英文或阿拉伯數字)。
一項來自 ArXiv 的最新研究,訓練了一個 3.18 億參數的 Transformer 語言模型,使用純文言文語料庫(15.6 億 token,不含任何英文或阿拉伯數字),探討語言模型能否學會表達不確定性——也就是說出「我不知道」的能力。
內部訊號與外部表達的斷裂
研究團隊透過系統性的分布外測試,發現模型內部存在明確的不確定性訊號。在面對虛構歷史事件時,模型的困惑度跳升 2.39 倍(p = 8.9e-11,每組 n = 92);半虛構事件(真實人物搭配虛構事件)的困惑度更高達 4.24 倍(p = 1.1e-16)。這證明模型確實編碼了事實知識,而非僅進行語法模式匹配。
然而,外部輸出卻呈現截然不同的景象:模型從未學會在生成文字中表達不確定性。對分布外問題使用文言文認知標記的比率僅 3.5%,低於分布內問題的 8.3%(p = 0.023)。研究團隊指出,這反映的是訓練資料中的修辭慣例,而非真正的後設認知能力。
跨語言與模型規模的一致性
這項發現並非偶然。研究團隊在三種語言(文言文、英文、日文)、三種書寫系統、以及八個不同規模的模型(從 1.1 億到 15.6 億參數)中,都觀察到相同的現象。其中,文言文模型呈現「謙遜悖論」——對已知主題反而使用更多模糊用語;而日文模型幾乎從不修飾不確定性。
研究結論與啟示
研究團隊認為,元認知表達——也就是說出「我不知道」的能力——無法單純從語言建模中湧現,需要 RLHF(基於人類回饋的強化學習)等明確訓練訊號。這項發現對 AI 安全與可信度具有重要意義:即使模型內部知道答案不確定,也可能在輸出中表現得過於自信。
延伸閱讀
- Inverse Learning 與 Inverter 框架:以前向/逆向模型實現序列化決策與階層化規劃
- 從 Gittins 到 CAUSE:以 Kalman 濾波分離波動性與觀測噪聲以優化探索策略
- MATE:以轉移嵌入求和記憶在 CMDP 中建立置換不變且高效的表徵
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。