深度分析
層級化微調提升指令遵循:Mid‑Block Efficient Tuning 實驗與分析
研究重新檢視監督式微調的層級效應,發現中層(20%‑80%)較為穩定、最上層敏感。提出只調整關鍵中間層的 Mid‑Block Efficient Tuning,於 GSM8K 測試中提升最高 10.2%。結果顯示對齊能力局部化,對未來微調與安全性平衡具重要啟示。
深度分析
研究重新檢視監督式微調的層級效應,發現中層(20%‑80%)較為穩定、最上層敏感。提出只調整關鍵中間層的 Mid‑Block Efficient Tuning,於 GSM8K 測試中提升最高 10.2%。結果顯示對齊能力局部化,對未來微調與安全性平衡具重要啟示。
深度分析
隨著開源適配器在同一擴散模型上累積,結合多風格權重成為需求。研究提出頻域驅動的動態 LoRA 切換與自動生成對齊機制,提升融合效率並減少細節流失。實驗顯示 FREE‑Switch 能大幅降低客製化圖像生成的訓練成本。
FLeX
研究者提出 FLeX 技術,透過結合 LoRA 微調與傅立葉正則化,成功提升大語言模型從 Python 到 Java 的跨語言程式碼生成能力。實驗證明,少量高品質數據集能超越過往微調模型,而傅立葉正則化能顯著增加跨語言遷移效率,將 Java 任務表現提升至 42.1% pass@1。
跨語言轉移
針對低資源語言在大型語言模型中的表現不均問題,最新研究提出一套專為圖爾基語系設計的理論框架。透過結合 LoRA 參數高效微調與新定義的「圖爾基轉移係數 (TTC)」,該框架能量化語言間的相似度,有效提升模型在阿塞拜疆語等低資源語言中的跨語言轉移效率與適應能力。