深度分析 DSS-GRPO 以難度分級壓縮 CoT 推理鏈,兼顧效率與正確性 大型語言模型(LLM)的鏈式思考(CoT)雖能提升推理可靠性,卻也帶來高昂的 token 成本。為此,研究者提出「難度分級區段式 GRPO(DSS-GRPO)」技術,在強化學習框架中將回饋訊號拆解為「思考(think)」與「答案(answer)」兩段,並以硬遮罩隔離,確保壓縮壓力只作用於推理過程,不影響用戶端答案的完整性與長度。