深度分析 AdaMame‑GRPO:提升大型推理模型多語言一致性與 token 效率的雙階段訓練方法 大型推理模型在非英文查詢常出現語言崩潰。AdaMame 透過兩階段 SFT+RL,使用查詢條件對齊因子自適應調整語言,兼顧正確率與語言一致性。實驗顯示在 12 種語言上,同時提升答案正確率與語言忠實度,且降低 token 用量,此方法亦為未來多語言 AI 部署提供可行路徑。