深度分析
多智能體數學推理:評審者精度高不等於採納率高,研究揭示批評轉化才是關鍵
一項針對4,181道奧數題的研究發現,多智能體系統中專門評審者的錯誤檢測精度雖高(0.861 vs 0.644),但批評被後續答案採納的比例卻遠低於廣播式討論(0.336 vs 0.935),導致最終解題率反而落後。研究指出,評審者精度與批評採納是兩個可獨立測量的維度,設計時須同時關注。
深度分析
一項針對4,181道奧數題的研究發現,多智能體系統中專門評審者的錯誤檢測精度雖高(0.861 vs 0.644),但批評被後續答案採納的比例卻遠低於廣播式討論(0.336 vs 0.935),導致最終解題率反而落後。研究指出,評審者精度與批評採納是兩個可獨立測量的維度,設計時須同時關注。
深度分析
電商平台採用群眾陪審處理大量交易爭議,但多回合、多模態且依平台慣例的證據結構,挑戰現有模型的判決能力。研究提出VerdictBench——一個包含6,000件真實案例、並附17人陪審團判決結果的多模態資料集,並以CyberJurors框架回應此需求。