深度分析
Agent Psychometrics:以項目反應理論預測程式代理人任務難度的新框架
隨著大型語言模型(LLM)從靜態單步程式碼生成轉向多步驟的代理人互動,評估程式代理人的難度與成本急遽升高。現行僅以整體通過率(pass rate)評分的方式,無法揭露不同任務間的難度差異,且大規模評估耗費驚人。
深度分析
隨著大型語言模型(LLM)從靜態單步程式碼生成轉向多步驟的代理人互動,評估程式代理人的難度與成本急遽升高。現行僅以整體通過率(pass rate)評分的方式,無法揭露不同任務間的難度差異,且大規模評估耗費驚人。
深度分析
隨著大型語言模型快速迭代,傳統以單一分數評估已顯不足。研究提出JE‑IRT幾何嵌入框架,將模型與題目同投射於共享空間,方向代表語意、向量長度代表難度,透過幾何交互預測正確率。實驗證明此法能解釋跨領域表現下降,並以輕量嵌入快速納入新模型,顯示出與人為科目劃分不同的內部分類。
深度分析
自動提示優化需大量評估成本,研究提出 POES 以 IRT 辨識效用、覆蓋項與切換成本為目標,形成子模組保證。實驗顯示在相同預算下提升 6.2% 準確度,且以 20 樣本即可匹配 30‑50 樣本的效果,顯著降低 token 消耗。