速報 日文推理模型突破:以 Qwen‑3‑Swallow‑8B 與 GRPO 訓練的實驗結果 研究團隊針對大型語言模型的推理語言限制,開發了日文推理變體 Qwen‑3‑Swallow‑8B,採用持續預訓練與 GRPO 方法。模型在程式碼、數學與科學基準測試中表現與英語推理基線持平,但在日文文化相關測驗上仍不如既有模型。結果顯示語言控制可行,然而僅靠日文推理並未自動提升文化任務表現,未來仍需針對語言與文化結合進行更深入研究。