深度分析
「Bag of Dims」:Transformer 隱層維度符號的零訓練可解釋性突破
隨著大型語言模型應用增多,解讀其內部運算成為關鍵。本研究提出 Bag of Dims 框架,將 transformer 隱層視為獨立二元暫存器,僅憑符號即可讀取語意特徵。實驗顯示符號模式可在無訓練情況下達到 80% 以上的預測準確,並比現有 SAE 方法更高效。
深度分析
隨著大型語言模型應用增多,解讀其內部運算成為關鍵。本研究提出 Bag of Dims 框架,將 transformer 隱層視為獨立二元暫存器,僅憑符號即可讀取語意特徵。實驗顯示符號模式可在無訓練情況下達到 80% 以上的預測準確,並比現有 SAE 方法更高效。
深度分析
隨著大型推理模型產生長篇推理序列,傳統以解釋預測行為的方法難以套用。本研究提出行為預測器,直接從單一推理軌跡學習預測模型重跑答案一致性與輸入變動敏感度。實驗顯示,預測器在三個推理資料集上較GPT‑5.4與ClaudeOpus 4.6更準確,且推理成本僅為其千分之一。