深度分析 突破英文中心主義:Qwen3.5-27B 透過 SFT 與 GRPO 實現土耳其語原生推理 針對多語言 AI 常以英文思考再翻譯成目標語言的問題,TÜDÜM 專案利用 Qwen3.5-27B 建立土耳其語推理管線。該方案先透過 LoRA 進行監督式微調以強制思考路徑土耳其語化,隨後導入 GRPO 強化學習優化數學表現。實驗發現 SFT 能有效將思考過程轉為土耳其語,雖導致整體準確率下降,但 RL 可部分恢復數學能力。