可驗證獎勵強化學習 (RLVR)
在資料與算力受限下:以 RLVR 微調 Qwen3-4B 等小型語言模型的實驗結果
在資料與運算受限的情境下,研究檢視以可驗證獎勵強化學習(RLVR)微調小型語言模型的成效。作者使用三套程序化資料集(計數、圖形推理、空間推理),控制題目複雜度與多樣性進行實驗。結果指出混合難度訓練在低資料條件下帶來最佳樣本效率,最高可達5×提升,並支援未來建立RLVR資料尺度法則。
可驗證獎勵強化學習 (RLVR)
在資料與運算受限的情境下,研究檢視以可驗證獎勵強化學習(RLVR)微調小型語言模型的成效。作者使用三套程序化資料集(計數、圖形推理、空間推理),控制題目複雜度與多樣性進行實驗。結果指出混合難度訓練在低資料條件下帶來最佳樣本效率,最高可達5×提升,並支援未來建立RLVR資料尺度法則。
深度分析
研究聚焦警民對話去升級訓練,提出DeEscalWild基於實境影片蒐集1500例高品質場景,使用小型語言模型微調,顯著提升多項指標,證明低資源模型可媲大型模型,同時降低運算成本,適合邊緣裝置部署。
深度分析
隨著小型語言模型在邊緣裝置的需求上升,傳統加速器在自回歸解碼階段受限於記憶體帶寬。EdgeCIM 以65nm記憶體內運算宏核搭配平鋪映射策略,平衡流水線以提升平行度並降低DRAM負擔。實驗顯示其在多模型測試中達到顯著的吞吐量與能源效率提升,成為邊緣即時推論的可行方案。
深度分析
研究探討小型語言模型情緒向量幾何,抽取21種情緒於六種架構1‑8B模型,發現成熟模型情緒幾何高度相似,RLHF僅重塑未成熟模型,方法層級影響需分層解讀。
深度分析
大型語言模型在工具使用上表現優異,但小型模型部署受限。研究提出將同一模型在推理時分為摘要、主代理與校正三角色,透過結構化腳手架提升效能。實驗顯示,8B 模型在此編排下的任務完成率約翻倍,接近 33B 大模型表現。