深度分析 「Agent-as-a-Judge」多語言本地化對大型語言模型評估排名的影響分析 本研究探討評估語言對Agent-as-a-Judge判斷的影響,將評分提示本地化至英、阿、土、中文、印語,測試六種大型語言模型於55項開發任務。結果顯示,不同語言會改變模型排名,GPT‑4o在英文表現最佳,而Gemini在阿拉伯語與印地語領先,突顯語言是評估的重要變數。