深度分析
知識圖譜提升 LLM 在工業資產運營的精準度:從 65% 到 99% 的實驗結果
在工業資產管理的海量結構化資料上,研究者將傳統的文件資料庫換成知識圖譜,讓大型語言模型改為生成結構化查詢。此做法將原本65%的任務完成率提升至99%(決策式圖處理)或82%以上(LLM產生Cypher)。此外,擴增40項圖本位測試,於467情境皆保持100%通過。
深度分析
在工業資產管理的海量結構化資料上,研究者將傳統的文件資料庫換成知識圖譜,讓大型語言模型改為生成結構化查詢。此做法將原本65%的任務完成率提升至99%(決策式圖處理)或82%以上(LLM產生Cypher)。此外,擴增40項圖本位測試,於467情境皆保持100%通過。
深度分析
隨著LLM規模持續擴大,單GPU微調面臨記憶體瓶頸。SlideFormer採用層滑動架構、輕量非同步引擎與異構記憶體管理,將GPU與CPU、NVMe資源協同運作,實現單RTX4090可微調123B以上模型,效能提升1.4至6.3倍,記憶體使用減半,同時支援8倍批次大小與6倍模型規模,且在NVIDIA與AMD GPU上保持超過95%峰值效能。
深度分析
本研究針對 NVIDIA Nemotron 推理挑戰中的位元操作謎題,提出以字串相似度與結構化回溯取代傳統布林門推導的全新框架,藉由 22 種空間基底與最小位翻轉抽取約束,實現高達 98.6% 的解題正確率,顯示 LLM 在組合爆炸問題上的可行性,並為未來 AI 推理工具鏈提供新方向。
速報
隨著 AI 原生應用的興起,購物體驗正從頁面與資訊流瀏覽轉向以意圖為導向的 LLM 代理人。現有的設計多將大型語言模型包裹在搜尋與推薦管線上,導致語意理解與商品空間執行之間出現斷層。為解決此瓶頸,研究團隊提出 ShopX,將意圖理解、執行規劃與基於語意 ID(SID)的商品操作統一於單一基礎模型。
速報
受規範產業的LLM需同時兼顧合規與成本。研究以編碼分類器先行評估查詢,將含個資的請求路由至本地模型,簡單查詢則使用小型快速模型。測試顯示延遲減少39%、成本降低最高52%,且生成吞吐提升至每秒200字元,分類器準確度99.2%,確保合規部署可行。
速報
近期大型語言模型(LLM)在推理過程中仍會出現偏見,研究團隊發現一種稱為「演繹刻板」的失效模式:模型將族群統計規律套用到個別案例,產生表面合乎邏輯卻具社會偏見的推論。為了引導模型進行公平感知的推理,作者提出「推理時間注入」框架,並開發 Fair‑GCG 系統自動搜尋有效的注入語句。
深度分析
隨著大型語言模型普及,後門攻擊成為重大威脅。研究提出彎曲指導的模組定位結合低階矩陣修復,只針對關鍵模組去除觸發行為,實驗在Llama‑3.2‑1B‑Instruct上大幅抑制惡意回應且保留正常功能。方法以激活貼補與Fisher/K‑FAC曲率定位高影響模組,再以低秩適配器修復,較CROW表現更佳,預示未來能快速除毒而不損效能。
AI Index 2026
2026 年斯坦福 AI 指數報告提供 AI 發展全景。美中在大型模型表現上幾乎持平,且美國資料中心耗電近 30 GW。模型持續突破但基準測試與監管落後,對產業與社會產生深遠影響。
Lean 形式化
研究以書面定理結合形式化表示,開發可探索定理系統,利用 LLM 轉譯為 Lean 程式碼並提供步驟互動。使用者可測試例子、追蹤依賴,實驗顯示提升理解與正確性。
大型語言模型
研究以三份線上調查作為基礎,將受訪者的網路、人口與態度特徵餵入大型語言模型,模擬錯資訊信念與分享行為。結果顯示模型能捕捉分佈趨勢,卻系統性放大信念與分享的關聯,且忽略個人網路特徵。此偏差顯示LLM在社會科學模擬上的限制,適合用於辨識與人類判斷的差異。
深度分析
資料稀缺與長尾不平衡持續挑戰視覺任務。Gen-n-Val 結合 LD、LLM 與 VLLM 以代理人方式生成單物件影像與遮罩,並以 VLLM 過濾低質樣本。實驗證明在 LVIS、COCO 與開放詞彙偵測上均顯著提升效能,顯示其在合成資料領域的突破。
深度分析
大型語言模型易因知識錯誤產生幻覺,研究提出編輯錨點壓縮(EAC)以限制序列編輯時參數偏移。EAC 選取重要且偏離度低的錨點壓縮資訊,保留模型通用能力。實驗顯示EAC能將通用能力保持超過七成,同時提升編輯知識保存效果。