深度分析
從 CTP 到 CTBE:共享初始化與表徵對齊在模型蒸餾與 LLM 微調中的影響
研究指出,當教師與學生模型共享初始權重且學習率足夠小時,即使學生只接受純噪音訓練,也能繼承教師的數字分類能力。此現象被稱為隱蔽特徵傳遞,核心機制是表徵對齊而非資訊傳遞。實驗顯示,凍結輸入投影會破壞傳遞,而凍結輸出投影則不影響,證實幾何對齊是關鍵。
深度分析
研究指出,當教師與學生模型共享初始權重且學習率足夠小時,即使學生只接受純噪音訓練,也能繼承教師的數字分類能力。此現象被稱為隱蔽特徵傳遞,核心機制是表徵對齊而非資訊傳遞。實驗顯示,凍結輸入投影會破壞傳遞,而凍結輸出投影則不影響,證實幾何對齊是關鍵。
深度分析
在合作性與法規場域下要求選擇性遺忘的情境引出研究議題。Mirage以表示層稽核──含線性探針、CKA、可分離性評分與分層回復分析──衡量遺忘是否真實。結果指出,多數方法雖通過輸出級認證,內部表徵仍保留可線性回復的類別結構,顯示表徵層遺忘與輸出行為間有顯著脫節。
HILBERT
HILBERT(HIerarchical Long-sequence Balanced Embedding with Reciprocal contrastive Training)提出一套面向長篇文件級音訊—文字表示的多模態框架,特別適用於資料稀少與音訊維度遠高於文字的情境。