深度分析
BatchDAG:以 LLM 規劃有向無環圖,解決企業大規模資料的臨時分析難題
大型語言模型(LLM)在分析個別文件時表現優異,但面對企業級資料集的跨實體分析問題,常因上下文超載、逐實體歸因遺失與順序工具呼叫的線性延遲而失效。
深度分析
大型語言模型(LLM)在分析個別文件時表現優異,但面對企業級資料集的跨實體分析問題,常因上下文超載、逐實體歸因遺失與順序工具呼叫的線性延遲而失效。
深度分析
現有 LLM 代理人的工具使用測試過於線性,研究者推出 The Amazing Agent Race(AAR)基準,以 DAG 謎題結合維基百科導航與多步工具鏈,提供 1,400 個測試實例。三項指標顯示最佳模型僅有 37.2% 正確率,導航錯誤最為突出,揭示線性基準的盲點。