深度分析 利用 GSPO 強化學習提升 LLM 生成 BPMN 流程的語法與語意品質 大型語言模型(LLM)已能從自然語言敘述產出 BPMN 流程圖,但僅靠監督微調(SFT)會受限於訓練資料的模式。研究以 Group Sequence Policy Optimization(GSPO)結合 38 項自動化指標,對 Llama 3.1 8B 與 Qwen 2.5 14B 兩大模型進行 48 種獎勵配置的實驗。