文言文 AI 模型揭露「我不知道」的困境:語言模型學不會表達不確定性

研究團隊從零訓練了一個 3.18 億參數的 Transformer 語言模型,使用純文言文語料庫(15.6 億 token,不含任何英文或阿拉伯數字)。

Transformer模型輸出文言文不確定性訊號

一項來自 ArXiv 的最新研究,訓練了一個 3.18 億參數的 Transformer 語言模型,使用純文言文語料庫(15.6 億 token,不含任何英文或阿拉伯數字),探討語言模型能否學會表達不確定性——也就是說出「我不知道」的能力。

內部訊號與外部表達的斷裂

研究團隊透過系統性的分布外測試,發現模型內部存在明確的不確定性訊號。在面對虛構歷史事件時,模型的困惑度跳升 2.39 倍(p = 8.9e-11,每組 n = 92);半虛構事件(真實人物搭配虛構事件)的困惑度更高達 4.24 倍(p = 1.1e-16)。這證明模型確實編碼了事實知識,而非僅進行語法模式匹配。

然而,外部輸出卻呈現截然不同的景象:模型從未學會在生成文字中表達不確定性。對分布外問題使用文言文認知標記的比率僅 3.5%,低於分布內問題的 8.3%(p = 0.023)。研究團隊指出,這反映的是訓練資料中的修辭慣例,而非真正的後設認知能力。

跨語言與模型規模的一致性

這項發現並非偶然。研究團隊在三種語言(文言文、英文、日文)、三種書寫系統、以及八個不同規模的模型(從 1.1 億到 15.6 億參數)中,都觀察到相同的現象。其中,文言文模型呈現「謙遜悖論」——對已知主題反而使用更多模糊用語;而日文模型幾乎從不修飾不確定性。

研究結論與啟示

研究團隊認為,元認知表達——也就是說出「我不知道」的能力——無法單純從語言建模中湧現,需要 RLHF(基於人類回饋的強化學習)等明確訓練訊號。這項發現對 AI 安全與可信度具有重要意義:即使模型內部知道答案不確定,也可能在輸出中表現得過於自信。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more