深度分析 AJPO 框架結合 ALLM 與 DPO 提升 Text-to-Audio 指令遵循能力 現有文字轉音訊模型雖音質優異,但常無法精準遵循多事件與時間順序指令。本研究提出 AJPO 框架,利用音訊感知大語言模型作為評判員,針對聲音事件完整度與時間順序提供細粒度回饋,並透過直接偏好最佳化提升模型表現。實驗結果顯示,該方法能有效改善生成音訊的事件完整性與時間正確性,並推出 S3Bench 基準測試以強化評估。