深度分析 LLM-as-a-Judge 陷阱:解析多國語言與低資源語言評估的可靠性危機 隨者 LLM-as-a-Judge 成為 NLP 任務的主流評估方式,其在多國語言環境下的可靠性受到質疑。研究人員分析 ACL Anthology 論文發現,許多研究在低資源語言中過度依賴單一 LLM 評審,且缺乏針對目標語言的人類驗證,導致評估結果可能被高估。這凸顯了現有評估體系在非英文環境的脆弱性,研究建議必須建立針對低資源語言的驗證機制以確保司法或安全等高風險輸出的可靠性。