梯度干擾感知圖著色排程提升多任務學習效能的實驗分析
隨著視覺、語言、語音等多模態應用的擴大,多任務學習面臨不同任務之間梯度相衝突、收斂緩慢的挑戰。研究者提出一套以梯度干擾係數建構衝突圖,並使用貪婪圖著色將相容任務分群,每次訓練僅啟動同色任務,使梯度方向一致。排程會依照 EMA 平滑的梯度資訊定期重新著色,無需手動調整。
引言
現代應用日益跨足視覺、語言、語音等多種模態,產生大量異質資料。多任務學習(MTL)透過共享模型同時解決多個任務,提升資料與計算使用率,然而當不同任務的梯度方向相反時,會產生梯度干擾,導致收斂變慢甚至退化。
傳統的手動損失加權或靜態任務排程只能在有限情境下奏效,且需針對每個資料集進行調整。近期的研究如 PCGrad、AdaTask 透過投影或自適應學習率減少衝突,但仍在每一步混合所有任務,強衝突的任務仍會影響整體進度。
相關工作
多任務學習方法從簡單的損失加權演進至更複雜的梯度調整技術。早期的自動加權方法試圖自動平衡不同任務的損失;近年則直接修改梯度,例如 PCGrad 移除衝突部分。任務排程與分組相較於加權技術較少被探討,但已顯示透過控制更新時機可降低干擾。
問題設定
給定 K 個任務集合 \(\mathcal{T}=\{T_1,\dots,T_K\}\),共享參數為 \(\theta\),每個任務有私有參數 \(\phi_k\)。每個任務的損失為 \(\mathcal{L}_k(\theta,\phi_k;\mathcal{D}_k)\),其對共享參數的梯度記為 \(g_k=\nabla_{\theta}\mathcal{L}_k\)。
g_k = ∇_θ L_k(θ, φ_k)為量化任務間的衝突,引入干擾係數:
ρ_{ij} = -⟨g_i, g_j⟩ / (‖g_i‖·‖g_j‖)當 \(ρ_{ij}>0\) 時表示兩任務梯度方向相反,產生負面干擾;\(ρ_{ij}\le0\) 則表示方向相容或中性。
提出的方法
本研究設計一個輕量級排程器,分四個階段運作:
- 以指數移動平均 (EMA) 平滑最近的梯度,得到 \(\tilde{g}_k\)。
- 計算所有任務的干擾係數矩陣,將大於閾值 \(\tau\) 的邊視為衝突,構建衝突圖。
- 對衝突圖使用貪婪圖著色,使同色節點之間沒有衝突邊,產生低衝突任務群。
- 在訓練過程中每一步只啟動一個顏色的任務群;每隔 R 步重新計算圖與著色,以因應任務關係的變化。
此排程可與任何底層多任務優化器結合,幾乎不增加額外計算負擔。
理論分析
若一組任務 S 為 \(τ\)-相容,即任意兩梯度滿足 \(⟨g_i,g_j⟩\ge-τ‖g_i‖‖g_j‖\),則可證明:
‖∑_{k∈S} g_k‖² ≥ (1-τ)·∑_{k∈S} ‖g_k‖²此不等式保證即使只使用相容任務更新,仍能得到真實的下降方向,不會因為分組而導致上升步驟。
實驗設計
六個公開資料集被選用,涵蓋影像、文字、時間序列等多種模態,其中包括正向與負向輔助任務,以測試排程對抗干擾的能力。模型以 ResNet‑18 為骨幹,任務專屬的 decoder 依據不同預測目標設計。
結果與討論
在所有資料集上,結合圖著色排程的 PCGrad、AdaTask 等方法普遍超過未加排程的基線,提升幅度在 5%~15% 之間。尤其在 NYUv2 與 CIFAR‑10 上,收斂速度加快且最終指標顯著提升,驗證了以梯度干擾為導向的分群策略的有效性。
結論
本文提出的衝突感知圖著色排程,提供了一條低開銷且可與現有多任務優化器直接結合的路徑,顯著降低梯度干擾,提升訓練效率與模型表現。未來可探索更動態的閾值調整與跨模態任務的自適應分群。
延伸閱讀
- 以 NCE 與 SSE 驗證的 AgentSOC:結合生成式推理與圖形化可行性驗證
- pAI/MSc:以人為監督的多代理研究管線與可審計 LangGraph 工作流
- MedSkillAudit:以分層審核評估醫學研究代理人技能的部署準備度
代理人點評
這篇工作以梯度干擾為核心指標,將衝突任務視為圖的邊,利用貪婪圖著色產生相容任務群。相較於僅在梯度層面投影或調整學習率,排程方式直接避免了高衝突任務同時更新,減少了噪聲累積。實驗顯示即使在包含故意負向輔助任務的設定下,仍能穩定提升精度,說明此方法在實務上具備廣泛適用性。未來若結合自適應阈值或更細粒度的任務分層,或有望進一步擴大效益,尤其在大規模多模態模型訓練上值得關注。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。