深度分析 以區塊式政策漂移門控強化 On‑Policy Distillation 數學推理表現 本研究聚焦於長序列推理任務中 On‑Policy Distillation(OPD)容易因學生策略漂移而失效的問題,提出一種輕量級的區塊式政策漂移門控機制。