深度分析 vLLM V0 升級 V1 實錄:在強化學習 RL 中,「正確性」優先於「補正」 ServiceNow-AI 團隊在將推論引擎從 vLLM V0 升級至 V1 時,發現強化學習訓練指標出現異常偏離。團隊透過修正 logprob 語義、調整運行時預設值、同步權重更新路徑,並將最終投影層設為 fp32 精度,成功將 V1 訓練曲線與 V0 基准對齊。此舉證明在 RL 遷移過程中,確保推論後端行為的一致性比單純在目標函數中加入補正項更為關鍵。