速報 Transformer 內部運作揭秘:研究人員成功提取 RASP 程式碼 研究人員探討 Transformer 模型在處理演算法任務時的運作機制。透過將訓練後的模型重新參數化為 RASP 程式語言並運用因果干預技術,研究團隊成功從模型中提取出簡潔且可解釋的子程式。實驗結果顯示,具備長度泛化能力的模型內部確實實作了簡單的 RASP 程式,此發現為理解模型內部邏輯提供了直接證據。