深度分析
以引用決策評估大型語言模型的學術關聯工作生成:RWGBench 介紹
隨著科研文獻激增,自動化關聯工作生成需求提升。RWGBench以引用決策為核心,提供100篇金標本與千萬檢索庫,評估引用選擇、組織與語篇結構。實驗顯示現有模型在引用精準度上仍不足,凸顯檢索與生成瓶頸。此基準亦比對傳統摘要相似度指標,揭露模型在引用選擇上的系統性缺陷。
深度分析
隨著科研文獻激增,自動化關聯工作生成需求提升。RWGBench以引用決策為核心,提供100篇金標本與千萬檢索庫,評估引用選擇、組織與語篇結構。實驗顯示現有模型在引用精準度上仍不足,凸顯檢索與生成瓶頸。此基準亦比對傳統摘要相似度指標,揭露模型在引用選擇上的系統性缺陷。
速報
科學研究仰賴精準文獻檢索。提出 IntraView 任務與 LLM 代理 IntrAgent,採兩階段流程:Section Ranking 先排序章節,Iterative Reading 再反覆抽取與綜整細節。以 IntraBench(315 題、覆蓋五個 STEM 領域)驗證,跨域準確度平均提升 13.2%。