日文推理模型突破:以 Qwen‑3‑Swallow‑8B 與 GRPO 訓練的實驗結果
研究團隊針對大型語言模型的推理語言限制,開發了日文推理變體 Qwen‑3‑Swallow‑8B,採用持續預訓練與 GRPO 方法。模型在程式碼、數學與科學基準測試中表現與英語推理基線持平,但在日文文化相關測驗上仍不如既有模型。結果顯示語言控制可行,然而僅靠日文推理並未自動提升文化任務表現,未來仍需針對語言與文化結合進行更深入研究。
背景與動機
大型語言模型在英語推理上表現最佳,主要因為英語訓練資料最豐富。然而,推理過程的可解釋性與安全性需求,使得在使用者母語進行推理變得重要。
研究方法
研究團隊以 Qwen‑3‑8B 為基礎,持續預訓練出日文版 Qwen‑3‑Swallow‑8B,並採用 GRPO(Gradient‑Regularized Prompt Optimization)技術控制模型以日文進行推理。
實驗設計
模型在以下三大領域的基準測試中進行評估:
- 程式碼(coding)
- 數學(math)
- 科學(science)
此外,亦加入日文文化相關基準,以觀察語言切換對文化任務的影響。
主要結果
在程式碼、數學與科學測試中,日文推理模型的表現與最強的英語推理基線相當,證明語言控制在技術層面是可行的。然後,在日文文化基準上,模型的成績低於現有的日文基線模型,顯示僅靠日文推理並不會自動提升與文化相關的任務表現。
結論與未來方向
此研究證實了以 GRPO 方式訓練的持續預訓練日文模型能夠在多領域推理任務中保持競爭力,但要提升文化特定任務仍需額外的語料或調整。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。