深度分析 OrderBench 基準測試:LLM 代理在語意可靠性的結構化輸出漏洞 一篇來自 ArXiv 的研究論文「When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents」指出,儘管大型語言模型(LLM)在 JSON Schema 與結構化輸出模式下能達到 100% 的語法有效性,但在實際交易場景中。