深度分析 GenAI Evaluation:打造零售業 AI 代理人的大規模多維度評估治理體系 零售業對話式 AI 代理人需要超越單純文字比對的評估方式。本研究提出 GenAI Evaluation 治理管線,利用 LLM-as-a-judge 實現多維度自動評分,並導入選擇性重新評估機制以降低計算成本並提升完整度。透過對 200 萬筆真實對話紀錄的測試,分類任務 F1 分數達 0.93,證明該框架能提供可審計且可擴展的品質監控方案。