深度分析 CDR‑Bench:評估大型語言模型在資料精練流程的程序忠實度與順序感知 隨著生成式AI在資料前處理的需求提升,研究團隊推出CDR-Bench以測試大型語言模型在多步驟、順序敏感的資料精練食譜執行能否忠實。基於3,462筆跨四領域任務與29種運算子,評估模型在原子、無序與順序敏感三種設定下的表現。結果顯示,多數模型在組合與順序測試中成功率低於5%,凸顯程序忠實度仍是未解決的瓶頸。