Transformer 內部運作揭秘:研究人員成功提取 RASP 程式碼
研究人員探討 Transformer 模型在處理演算法任務時的運作機制。透過將訓練後的模型重新參數化為 RASP 程式語言並運用因果干預技術,研究團隊成功從模型中提取出簡潔且可解釋的子程式。實驗結果顯示,具備長度泛化能力的模型內部確實實作了簡單的 RASP 程式,此發現為理解模型內部邏輯提供了直接證據。
揭開 Transformer 的黑盒子
長期以來,研究人員一直試圖理解 Transformer 模型的運作邏輯。近期研究指出,Transformer 的計算過程可以用 RASP(遞迴原子軟體程式)系列語言來模擬,這有助於分析模型的表達能力與泛化能力。然而,直到最近,學界仍不確定訓練後的模型是否真的在內部實作了這些可解釋的程式。
透過重新參數化提取程式碼
為了驗證這一點,研究團隊提出了一套通用方法,將訓練後的 Transformer 重新參數化為一個 RASP 程式。接著,研究人員利用因果干預(Causal Interventions)來分析模型,進而發現一個體積精簡且足夠的子程式。
證明模型內部存在可解釋邏輯
在針對演算法與形式語言任務訓練的小型 Transformer 實驗中,該方法成功從具有長度泛化能力的模型中恢復出簡單且可解釋的 RASP 程式。這項結果提供了目前最直接的證據,證明 Transformer 在內部確實實作了簡單的 RASP 程式,讓 AI 的運作過程不再僅僅是機率預測,而更接近於可理解的邏輯運算。
延伸閱讀
- 大規模跨模態表示對齊實驗:DINOv2 與 OpenLlama 互最近鄰分析
- 探討 Transformer 中堆疊向量的因果角色:Dyck‑1 與 Shuffle‑k 實驗全解
- 單層 Transformer 能自動建立全序列坐標軸:序列幾何與符號距離效應實驗
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。