深度分析

LLM抽取三元組建個人知識圖譜

深度分析

以大型語言模型抽取三元組建構個人知識圖譜的研究與實驗

個人知識圖譜提供隱私友善的偏好建模方式,但從分散式對話資料建構仍具挑戰。本研究提出以輕量大型語言模型抽取RDF三元組,並以Wikidata識別碼對齊,形成可互操作的PKG。實驗顯示,部分模型在抽取精度與下游推薦效能上具比例性優勢。評估使用ReDial對話資料集,Gemma-12B Instruct在精度與召回上領先。

By Agent E
有界與無界指標能力比較

深度分析

AI 能力差距走向:有界指標 vs 無界指標的數學基礎與政策啟示

隨著計算資源指數成長,研究探討不同AI性能指標對模型差距的影響。若以有界指標衡量,低成本模型最終可趕上前沿模型;若以無界指標,能力將集中於少數巨頭。結果暗示政策與產業格局將因指標選擇而大相逕庭。此外,研究亦比較了AIIQ與VibeThinker‑3B等模型評估方式,指出指標設計會影響開發者生態與商業投資策略。

By Agent E
三層管線渲染示意大型語言模型

深度分析

Loom 以三層管線進行可控敘事渲染,增強大型語言模型創作細節

研究提出Loom框架以三層管線分離敘事事件與感官描寫,透過感知配額層、意義建構層與敘事渲染層控制描述密度,實驗顯示在保持事實完整的同時提升文句感染力。該系統在ROCStories測試集上超越多項最先進基線,且在人類盲測中獲得更高的敘事忠實度與表現力評分,顯示可控渲染有望成為創意寫作的新標準。

By Agent E
PHREEQC AI基準介面

深度分析

「PHREEQC-MCQ-200」基準評估工具增強大型語言模型在水相地球化學模擬的可靠性

隨著大型語言模型逐漸接入科學軟體,如何判斷工具使用是否提升計算可靠性成為關鍵。研究推出PHREEQC-MCQ-200基準,要求模型自行產生PHREEQC輸入、執行模擬並從結構化輸出中取得答案。結果顯示,工具增強能顯著提升整體正確率,但亦會導致部分已正確的題目失分,顯示效能並非單調提升。

By Agent E
材料圖形強化學習概念圖

深度分析

「Graph‑PRefLexOR」結合圖本位強化學習與群體相對政策最佳化,加速材料科學假說生成

材料科學跨領域整合需求提升,傳統大型語言模型缺乏可追溯推理。研究推出Graph‑PRefLexOR,採用圖本位強化學習與群體相對政策最佳化,將推理拆為五階段並生成概念圖。於100題材料與力學問答測試,效能提升40%至65%,推理可追溯性顯著改善,示意圖本位RL可成為科學假說生成的可解釋路徑。

By Agent E