深度分析
GRASP:粒度感知檢索策略的強化學習多步推理框架
隨著大型語言模型在多步推理上需求提升,傳統單次檢索已不足。研究提出 GRASP,透過強化學習讓模型在語意搜尋、關鍵字搜尋與段落閱讀間動態切換,僅在需要時擴充上下文。實驗顯示在 HotpotQA、2WikiMultiHopQA 與 MuSiQue 上,其檢索召回與問答正確率均超過現有單步與提示式基線。
深度分析
隨著大型語言模型在多步推理上需求提升,傳統單次檢索已不足。研究提出 GRASP,透過強化學習讓模型在語意搜尋、關鍵字搜尋與段落閱讀間動態切換,僅在需要時擴充上下文。實驗顯示在 HotpotQA、2WikiMultiHopQA 與 MuSiQue 上,其檢索召回與問答正確率均超過現有單步與提示式基線。
深度分析
大型語言模型逐漸被當作自動化評審,用於評估論點強度與協助多方協商,但把整場辯論壓成一個整體判決易導致不一致與不可解釋性。GRASP(逐步傳播攻防強度)提出以明確的攻擊—支援互動圖為基礎,先讓模型判斷局部兩兩關係,再透過可收斂的攻防傳播算子把局部判斷匯總成全域排序。
速報
理解多人視訊社會互動需解析細微非語言訊號。研究提出GRASP資料集,將注視、指向手勢與其組合轉為290K問答並分類,並以Social Grounding Reward做為學習訊號,引導模型推理互動參與者,實驗呈現於GRASP-Bench的績效提升。