深度分析 vLLM V1 移轉實務:先修正推論後端再校正強化學習目標 ServiceNow-AI在將推論引擎從vLLM V0升級至V1時,發現logprob計算不一致,導致RL訓練指標偏離。團隊先修正四項後端行為,包括processed_logprobs、執行時預設、即時權重更新與fp32lm_head,最終使指標回到V0水平。