大型語言模型

演化智慧驅動AI與語言模型

深度分析

「演化智慧」驅動 AI 科學發現:從演化計算到自動化實驗與大型語言模型的累積式探索系統

本報導深入探討演化智慧(EI)如何將傳統演化計算(EC)升級為支援累積式科學發現的框架。文章先說明 AI 從任務導向自動化向閉環探索系統的轉變,接著以五維分析模型說明 EI 在「演化目標、變異來源、選擇依據、回饋來源、演化時機」五個面向的設計要素,並比較現有 EC 方法在候選集、變異操作與回饋形式上的限制。

By Agent E
Neuro‑Agentic 大語言模型防護工業物聯網

深度分析

大型語言模型 × 時間序列基礎模型:Neuro‑Agentic 控制提升工業物聯網防護

隨著工業物聯網遭受惡意攻擊,傳統規則式監控已難以因應。研究提出結合大型語言模型與時間序列基礎模型的神經代理式控制框架,透過「反事實物理注入」在數值潛在空間模擬介入效果,篩除幻覺與不安全動作。實驗在 SWaT 資料集上顯示,較 LSTM、TCN 分別提升 33.3% 與 20% 的防護成功率,且未執行任何物理無效指令。

By Agent E
大型語言模型推理控制

深度分析

「CogniConsole」:透過推理時控制提升大型語言模型可靠性

隨著大型語言模型廣泛應用,可靠性傳統被視為模型能力問題。研究提出 CogniConsole,將推理時控制外部化為結構化介面,結合程式化協調與受限提示推理。實驗顯示在相同模型下,提升結構化程度可顯著降低輸出變異與失敗率,此方法挑戰僅靠擴大模型規模提升可靠性的觀點,並為未來 AI 代理系統的設計與評估提供新方向。

By Agent E
零售LLM決策模擬基準

速報

RetailBench:測試長期決策的零售 LLM 代理人基準

研究團隊推出 RetailBench,模擬單店超市的千日營運環境,讓大型語言模型(LLM)代理人在定價、補貨、供應商選擇、貨架配置、庫存老化、顧客回饋、外部事件與現金流限制等多重因素下運作。測試七種當代 LLM 於 180 天的表現,結果顯示只有少數模型能完整運作,且與理想的特權策略相比,最優模型在最終淨值與銷售上仍有顯著差距。

By Agent E