深度分析 CHERRY-1.8B:選擇性監督、深層壓縮與專家融合提升語言模型效能 面對大型語言模型訓練成本高企,研究提出以選擇性監督聚焦語意關鍵token、層級深度壓縮與MoE專家融合三項技術。實驗顯示,在僅500步、15%標註成本下,CHERRY-1.8B的效能接近全序列訓練,同時降低參數與計算需求。此方法為資源受限環境提供可行路徑。