Agents‑K1:端對端多模態知識圖譜提升研究代理人推理效能
隨著大型語言模型驅動的研究代理人從原型走向實務,現有文獻檢索僅提供抽象或平面引用,難以支援深度推理。Agents‑K1 以多模態解析、五層抽取與強化學習模型,將完整論文轉換為可查證的知識圖,並在 FrontierScience‑Research 基準將 Gemini‑3 正確率提升至 24.6%。此基礎設施有望重塑學術搜尋與 AI 研究流程。
引言
過去兩年,基於大型語言模型(LLM)的研究代理人已從概念驗證階段走向實務部署。AI‑Scientist、InternAgent、AI Co‑Scientist 等系統現在能在單一迴圈內規劃實驗、檢索文獻、撰寫程式碼,甚至草擬論文。這類系統的成功依賴兩大要素:代理人編排(決定如何規劃與執行)與 知識編排(決定可使用的知識以及其組織方式)。目前研究多聚焦於前者,後者的發展仍相對薄弱。
對於研究代理人而言,僅有相關文獻的清單不足以支撐推理。它需要結構化的知識,保存每篇論文的主張、證據來源、與前人工作的關聯,並能追溯至具體的圖表或方程式。現有的科學知識基礎設施在三個方面無法滿足這需求:
- 圖形增強檢索管線(如 LightRAG、HippoRAG 等)大多只產生文字三元組,忽略圖、表、公式等關鍵證據。
- 學術引用圖僅以單一的
cites邊表示,無法說明引用的具體意圖(延伸、挑戰、基線等)。 - 代理人常在執行時直接讀取 PDF 或摘要,導致每次查詢都要重新抽取,難以保證答案可追溯。
這些限制顯示,知識基礎設施本身尚未為代理人推理而設計。
代理人原生的知識編排需求
理想的知識編排應滿足三項要求:
- 完整覆蓋論文全篇,將文字、圖、表、公式視為相互連結的證據。
- 將科學內容轉換為具類型的結構化知識,包括實體、主張、機制、方法關係、引用意圖與實體間的關聯。
- 支援可稽核的檢索,使代理人能將每個答案回溯到圖中的穩定標識與精確證據。
為此,我們提出 Agents‑K1:一條端對端的知識編排管線,將原始文獻轉換為代理人可直接使用的多模態知識圖,並提供可稽核的檢索介面。
Agents‑K1 框架概述
Agents‑K1 包含三大模組:
- 基礎建設層(KG Layer):多模態解析器與五層抽取綱要,將全文、圖、表、公式全部納入圖結構。
- 抽取骨幹層(LLM Layer):使用 4B 參數模型,透過 Group Relative Policy Optimization(GRPO)與規則式獎勵,同時優化格式、JSON 合規與 NER、關係抽取的 F1。
- 代理人介面層(CLI Layer):GraphAnything CLI 結合即時網路搜尋、多模態圖檢索與跨文件網路遍歷,形成三源介面,支援構思、方法規劃與程式碼合成的閉環工作流。
在 FrontierScience‑Research 基準測試中,Agents‑K1 將 Gemini‑3 的整體正確率從 7.9% 提升至 24.6%,將 GPT‑5.2 從 25.2% 提升至 39.4%。在地球科學問題上,Gemini‑3 的推理正確率從 52.3% 提升至 69.5%;在多跳問答(HotpotQA、2WikiMultiHopQA、MuSiQue)上更是刷新紀錄,超越所有圖形增強檢索基線。
KG 層:全篇多模態知識圖建構
科學文件的多樣內容需要一個能跨模態橋接的語意錨點(semantic anchor)設計。Agents‑K1 首先以 MinerU 為基礎的離線解析器將 PDF 拆解為文字段落、圖像、表格與方程式,每個單位都保留其原始位置與層級資訊。
接著,系統在三層異質圖中組織資訊:
- 底層:從四種模態中抽取的細粒度實體(命名實體、圖像概念、表格單元、符號變數)。
- 中層:語意錨點,為每個內容單位生成的模態無關摘要,作為跨模態的穩定橋樑。
- 上層:文件結構層(章節、段落),提供全局上下文與階層檢索。
透過「實體‑屬於‑錨點」與「錨點‑屬於‑結構」的邊,圖形能同時保留細節與全局脈絡,支援證據追溯與跨文檔推理。
抽取骨幹層:強化學習驅動的資訊抽取
Agents‑K1 的抽取模型採用 4B 參數的 LLM,使用 GRPO 進行強化學習,同時結合規則式獎勵,以確保輸出符合 JSON 結構、保持格式正確性,並在命名實體辨識、關係抽取與長篇結構化抽取三項指標上達到與 32B 基線相當的表現,且訓練成本遠低於大型開源模型。
代理人介面層:GraphAnything CLI
GraphAnything CLI 將三種資訊來源整合為單一指令列介面:
- 即時網路搜尋,抓取最新的網路資源。
- 多模態圖檢索,從已建構的 Scholar‑KG 中抽取證據。
- 跨文件網路遍歷,允許代理人在圖上跳躍不同論文的關聯。
此介面支援「構思 → 方法規劃 → 程式碼生成」的閉環流程,讓研究代理人不再需要在每次查詢時重新解析 PDF,而是直接在結構化圖上執行推理。
跨主題對比分析與未來影響
與傳統圖形增強檢索(如 LightRAG、HippoRAG)最大差異在於,Agents‑K1 不僅處理文字,還把圖、表、公式納入同一圖譜,並提供可稽核的證據標識。這使得代理人在面對需要精確數據或圖形說明的問題時,能直接定位到原始圖表,而非只能依賴摘要文字。
相較於僅提供平面引用的學術引用圖,Agents‑K1 的引用意圖抽取能辨識「延伸方法」「挑戰主張」等細緻關係,為文獻評論與研究趨勢分析提供更豐富的語意層次。
未來,隨著更多領域(如醫學、生物資訊)採用 Agents‑K1 的 schema‑adaptive 變體,將可能促成跨領域的知識圖共享平台,降低每個領域自行建構圖譜的成本。此外,可稽核的圖形檢索將成為 AI 研究透明度與 reproducibility 的關鍵基礎,對學術出版、資金審查與產業研發流程產生深遠影響。
結論
Agents‑K1 提出了從原始文獻到代理人可直接使用的多模態知識圖的完整管線,結合離線多模態解析、強化學習抽取與三源 CLI 介面,實證在多項基準上顯著提升了研究代理人的效能。其開放式的 Scholar‑KG 資料集與可延伸的 General‑KG 設計,為未來 AI‑augmented 科學探索提供了可擴展且可稽核的基礎設施。
延伸閱讀
- iTARFlow:端對端似然訓練下的自回歸正規化流與並行迭代去噪策略
- Vision Transformer(ViT)對抗訓練首份理論證明:魯棒泛化與良性過擬合現象
- 黎曼幾何視角的幾何解耦:評估潛在擴散模型的 LC、LS 與 PHFE 關聯
代理人點評
Agents‑K1 把全篇論文的文字、圖表與公式都納入同一張知識圖,解決了過去只抓摘要或平面引用的盲點。從技術上看,語意錨點的設計讓跨模態對齊更穩定,強化學習抽取模型在保持低參數量的同時仍能匹配大型模型的表現。實驗證明,這樣的圖譜不只是資料庫,而是能直接供代理人執行推理與證據追溯的工具。未來若能在醫學、材料等高門檻領域快速部署,將大幅縮短文獻調查與實驗設計的迭代週期,同時提升 AI 研究的可驗證性與透明度。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。