速報
SLIDERS:以大型語言模型自動化系統性文獻回顧的證據表生成
系統性文獻回顧需大量蒐集與合成證據,手工製表耗時。SLIDERS 用大型語言模型自動生成證據表,抽取結構化資料與全文摘錄,並以自動對齊代理整合跨文件資訊、解決衝突,支援自然語言追問。測試在600萬至1100萬詞語料上正確率近90%,追問正確率分別為77.9%與58.3%。
速報
系統性文獻回顧需大量蒐集與合成證據,手工製表耗時。SLIDERS 用大型語言模型自動生成證據表,抽取結構化資料與全文摘錄,並以自動對齊代理整合跨文件資訊、解決衝突,支援自然語言追問。測試在600萬至1100萬詞語料上正確率近90%,追問正確率分別為77.9%與58.3%。
深度分析
隨著大型語言模型輸入長度持續增長,KV快取記憶體需求急升。研究提出SurfaceLogicKV,透過將注意力行為分為表面記憶與邏輯建構,於層與頭級別動態分配快取預算。實驗顯示在多項長序列任務上,壓縮後的效能與FullKV相當,甚至在部分測試中超越。
深度分析
本報導深入探討演化智慧(EI)如何將傳統演化計算(EC)升級為支援累積式科學發現的框架。文章先說明 AI 從任務導向自動化向閉環探索系統的轉變,接著以五維分析模型說明 EI 在「演化目標、變異來源、選擇依據、回饋來源、演化時機」五個面向的設計要素,並比較現有 EC 方法在候選集、變異操作與回饋形式上的限制。
深度分析
倉儲SOP複雜且需即時執行,Eluna以有向無環圖編碼流程,透過漸進揭露只呈現可達子圖,並採用非對稱蒸餾將大型教師模型的修正內化至32B學生模型,使其在實務基準上超越所有商用基線,票證處理任務達到94%專家一致性,顯示圖形導向代理可在高壓環境下提供可靠自動化。
速報
大型語言模型在逆向工程的應用持續擴大,但編譯最佳化使二進位與原始碼對齊變得不可靠。研究提出 Reforge 管線,從 C 原始碼經 DWARF 解析到反編譯,建立函式層級真實值,並以八層信心篩選。測試顯示高信心函式比例隨最佳化下降,未考慮此因素會高估模型效能。
深度分析
隨著大型語言模型結合可驗證回饋,OpenProver以Planner-Worker-Verifier架構將Lean4形式驗證納入自動定理證明;系統支援互動式終端,讓使用者即時監控與引導證明流程。實驗顯示在ProofNet上的成功率比線性基線提升超過20%。
深度分析
隨著工業物聯網遭受惡意攻擊,傳統規則式監控已難以因應。研究提出結合大型語言模型與時間序列基礎模型的神經代理式控制框架,透過「反事實物理注入」在數值潛在空間模擬介入效果,篩除幻覺與不安全動作。實驗在 SWaT 資料集上顯示,較 LSTM、TCN 分別提升 33.3% 與 20% 的防護成功率,且未執行任何物理無效指令。
深度分析
研究推出 Long‑Horizon‑Terminal‑Bench,收錄 46 項跨九大類的長程終端任務,採用子任務密集獎勵機制,讓代理人在完成最終目標前即可獲得部分分數。測試 15 種前沿模型發現,最高通過率僅 15.2%,顯示長程執行仍是主要挑戰與瓶頸。
深度分析
隨著大型語言模型廣泛應用,可靠性傳統被視為模型能力問題。研究提出 CogniConsole,將推理時控制外部化為結構化介面,結合程式化協調與受限提示推理。實驗顯示在相同模型下,提升結構化程度可顯著降低輸出變異與失敗率,此方法挑戰僅靠擴大模型規模提升可靠性的觀點,並為未來 AI 代理系統的設計與評估提供新方向。
World Monitor
World Monitor 是一套即時全球情報儀表板,結合 AI 新聞聚合、地緣政治監測與基礎建設追蹤,提供統一情境感知介面。採用 TypeScript 開發,採 AGPL v3 授權,已獲逾六萬星標,並提供科技、金融、能源等多領域專屬介面,支援 npm 安裝與 CLI 直接啟動。
深度分析
隨著大型語言模型(LLM)在程式開發中的廣泛應用,AI 幻覺產生的虛構套件名稱正成為供應鏈攻擊的切入口。研究指出,攻擊者可註冊這些幻覺套件,將惡意程式碼注入開發者的專案,形成所謂 Slopsquatting。
速報
研究團隊推出 RetailBench,模擬單店超市的千日營運環境,讓大型語言模型(LLM)代理人在定價、補貨、供應商選擇、貨架配置、庫存老化、顧客回饋、外部事件與現金流限制等多重因素下運作。測試七種當代 LLM 於 180 天的表現,結果顯示只有少數模型能完整運作,且與理想的特權策略相比,最優模型在最終淨值與銷售上仍有顯著差距。