ReTeX:恢復單一合併模型中任務專家表現的新框架
多任務模型合併常因參數干擾而削弱各任務專家的效能。研究提出 Recover Task eXpert(ReTeX)框架,將合併過程中的參數干擾視為可加性偏移,透過預測這些偏移值來還原單一合併檢查點中的任務專家表現。ReTeX 內建一套基於 SVD 子空間簽名的路由器自由任務辨識器,於推論時選取投影殘差最小的子空間,以辨識目標任務。
研究動機與挑戰
多任務模型合併旨在將多個任務專家整合成單一模型,但靜態合併方式常因參數干擾而導致各任務效能下降。動態合併雖能緩解此問題,卻需在推論時額外載入冗餘的專家組件,成本高昂。
核心概念:參數干擾即參數偏移
本研究將合併過程中的參數干擾視為對每個專家的參數擾動,並證明此擾動可建模為仿射變換,近似為加法偏移。基於此觀察,提出 Recover Task eXpert(ReTeX) 框架,透過預測這些偏移值,從單一合併檢查點中恢復任務專家的原始效能。
路由器自由的任務辨識
為在未知任務身份時選取正確的專家,ReTeX 事先計算每個任務的 SVD 子空間簽名。推論時,辨識器會測量輸入在各子空間上的投影殘差,選擇殘差最小的任務作為目標。
實驗結果
在視覺與自然語言處理兩大領域的測試中,ReTeX 能恢復超過 95% 的單任務專家表現,同時提升對未見任務的泛化能力。更重要的是,參數偏移的預測使模型在分布外任務上自動插值多個專家的知識,展現出適應性插值特性。
開源與未來方向
ReTeX 的實作已於 GitHub 公開,未來將持續探索更高效的偏移預測方法與跨領域任務的擴展。
延伸閱讀
- APPS 以未來價值因子與動態粒子分配優化 LLM 推理效能
- 深層 Transformer 的自適應貝葉斯推論與功能向量機制
- 儲備注意力網路 (RAN) 於預訓練 Transformer 的跨回合狀態記憶突破
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。