深度分析 「ARKD」結合強化學習與雙向 KL 散度提升 LLM 知識蒸餾品質 大型語言模型壓縮面臨知識蒸餾中分布擬合與泛化能力的權衡挑戰。研究團隊提出 ARKD 框架,利用強化學習驅動的策略網路,根據教師與學生模型的分布特徵動態調整前向與反向 KL 散度的權重,實現主模式與長尾分佈的雙重對齊。實驗證明 ARKD 在多個基準測試中均優於傳統靜態方法,顯著提升了小型模型的生成品質與跨領域泛化表現。