深度分析
透過 CPT 與方言對齊,DiaLLM 改善 LLM 在多種英語方言的生成品質
研究指出大型語言模型已能理解英語方言,卻仍只能產出標準美式英文。團隊提出DiaLLM框架,透過持續預訓練與顯式方言對齊,提升方言生成辨識度,揭示韌性與生成的斷層。實驗比較DPO、GRPO、GSPO,顯式方言適配產出被認可的方言風格,但最佳化獎勵的GRPO未獲偏好,顯示獎勵設計仍需改進。
深度分析
研究指出大型語言模型已能理解英語方言,卻仍只能產出標準美式英文。團隊提出DiaLLM框架,透過持續預訓練與顯式方言對齊,提升方言生成辨識度,揭示韌性與生成的斷層。實驗比較DPO、GRPO、GSPO,顯式方言適配產出被認可的方言風格,但最佳化獎勵的GRPO未獲偏好,顯示獎勵設計仍需改進。
深度分析
本研究針對法律領域語言模型的挑戰,提出以百川基礎模型為底的 WisdomInterrogatory(LuWen),透過大規模法律語料持續預訓練、精挑細選的指令微調,以及結合完整法律知識庫的檢索增強生成。實驗顯示在判決預測、司法考試、文本摘要等五項任務上均優於多項基線模型。