深度分析 「Bag of Dims」:Transformer 隱層維度符號的零訓練可解釋性突破 隨著大型語言模型應用增多,解讀其內部運算成為關鍵。本研究提出 Bag of Dims 框架,將 transformer 隱層視為獨立二元暫存器,僅憑符號即可讀取語意特徵。實驗顯示符號模式可在無訓練情況下達到 80% 以上的預測準確,並比現有 SAE 方法更高效。