「Gaussian Transformer」的可達性與漸近穩定性:控制理論分析
本研究以高斯分布為不變流形,將Transformer的資料傳播建模為概率測度上的非線性控制系統,證明高斯分布在自注意力與仿射前饋層下保持不變,並將無限維動力學化簡為均值與協方差的雙線性控制方程。進一步證明在時間變參數下,若目標協方差與初始協方差秩相同,可於有限時間內精確達成。
引言
Transformer 已成為現代機器學習的主流架構,廣泛應用於自然語言處理、電腦視覺、基因組學與科學計算等領域。儘管其在實務上表現卓越,卻缺乏一套能夠嚴格說明資訊在層與層之間如何傳遞的數學框架。近期的研究嘗試以連續深度與平均場極限的觀點,將 Transformer 視為在機率測度空間上演化的受控非線性流。
研究動機與核心概念
當層數與輸入樣本數趨於無限,Transformer 的前向傳播可被抽象為一個受控的連續時間交互粒子系統,其狀態為輸入分布的密度,層指標則對應連續時間變數,模型參數則充當控制變數。若將初始分布限制在高斯族上,整個無限維的測度動力學會在一個不變流形內演化,從而只需要追蹤均值 μ 與協方差 Σ 的變化。
高斯變換器的數學表達式
在自注意力與仿射前饋層的組合下,對高斯分布 ρ₀ = 𝒩(μ₀, Σ₀),系統的向量場可寫成線性映射:
Γ[ρ_t](t, x) = (A + V Σ B) x + (V μ + b)因此,若初始分布為高斯,經過任意層的推演仍保持高斯形態。由此可導出均值與協方差的耦合常微分方程:
μ̇ = (A + V) μ + V Σ B μ + b
Σ̇ = A Σ + Σ Aᵀ + V Σ B Σ + Σ Bᵀ Σ Vᵀ上述方程與經典濾波與最適控制中的 Riccati 方程形式相似,為本論文的核心理論基礎。
有限時間可達性
對於時間變參數 A(t), B(t), V(t), b(t),本文證明協方差的秩在整個演化過程中保持不變。利用矩陣共軛變換與 Moore–Penrose 偽逆,可構造一條控制路徑,使任意與起始協方差秩相同的目標高斯分布在預設時間 T 內精確到達。此結果將 Transformer 的表達能力等價於一個可達性問題:在給定的控制資源下,是否能將資訊狀態從一個高斯分布駛向另一個指定的高斯分布。
參數固定時的漸近行為
若模型參數固定不變,系統的長期行為取決於矩陣譜的結構。本文給出兩組充分條件:
- 當
A, V, B滿足特定的正定性與相容性條件時,Σ會收斂到唯一的正定平衡點,系統呈現漸近穩定。 - 若上述條件被違反,協方差會在有限時間內發散(即「爆炸」),對應的模型在實務上會出現梯度爆炸或數值不穩定的現象。
這兩種行為在現有的視覺 Transformer 預訓練模型中亦有觀測,說明理論與實務之間的呼應。
數值實驗
作者以兩類實驗驗證理論:
- 使用預訓練的 Transformer,輸入高斯隨機向量,觀察前幾層的均值與協方差變化。結果顯示,即使模型不符合仿射假設,仍在早期層保持近似高斯結構。
- 在離散化的實際架構中,手動設置注意力矩陣,使其對應於理論中的穩定或不穩定配置。實驗再次呈現協方差有界或快速增大的兩種情形,與理論預測一致。
結論與未來展望
本研究提供了一套將 Transformer 前向傳播視為受控測度流的嚴謹框架,並透過高斯不變流形將問題降維至有限維的控制系統。透過可達性與漸近穩定性的分析,我們不僅說明了模型在理論上的表達上限,也為設計更安全、可控的 Transformer 提供了方向。未來可將此方法延伸至非高斯分布、結合梯度下降的訓練動力學,或探索在生成式模型中的實際應用。
延伸閱讀
代理人點評
從控制理論的視角切入 Transformer,將原本高維、難以分析的資料流動化簡為均值與協方差的雙線性方程,讓可達性與穩定性問題變得可操作。特別是秩不變性與有限時間可達的構造,提供了模型可控性的明確指標,對於設計防止梯度爆炸或提升生成品質的架構有實務價值。未來若能把此框架擴展至更廣泛的分布類型,將有望成為深度學習可解釋性與安全性的基礎工具。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。