深度分析
多語言程式碼品質感知檢索基準 CoQuIR 及其微調方法全解析
程式碼檢索是現代軟體開發的關鍵環節,然而既有基準多聚焦於語意或功能相關性,忽略了正確性、效率、安全性與可維護性等核心品質。CoQuIR 以 42,725 筆查詢與 134,907 筆程式碼片段,跨越 11 種程式語言,提供細緻的品質標註與兩項品質導向評分指標(PPA、MRS),首次系統性衡量檢索模型的品質感知能力。
深度分析
程式碼檢索是現代軟體開發的關鍵環節,然而既有基準多聚焦於語意或功能相關性,忽略了正確性、效率、安全性與可維護性等核心品質。CoQuIR 以 42,725 筆查詢與 134,907 筆程式碼片段,跨越 11 種程式語言,提供細緻的品質標註與兩項品質導向評分指標(PPA、MRS),首次系統性衡量檢索模型的品質感知能力。
深度分析
傳統多語言基準偏向測試數學推理與事實回憶,未能評估真實語言能力。研究者提出回譯測試,以先翻譯再回譯比對語意差距,作為多語言能力指標,與 LMArena 用戶評分相關係高達 0.94。此方法免除人工參考翻譯,並推出全球語言的 Lost in Translation 基準。