速報
RetailBench:測試長期決策的零售 LLM 代理人基準
研究團隊推出 RetailBench,模擬單店超市的千日營運環境,讓大型語言模型(LLM)代理人在定價、補貨、供應商選擇、貨架配置、庫存老化、顧客回饋、外部事件與現金流限制等多重因素下運作。測試七種當代 LLM 於 180 天的表現,結果顯示只有少數模型能完整運作,且與理想的特權策略相比,最優模型在最終淨值與銷售上仍有顯著差距。
速報
研究團隊推出 RetailBench,模擬單店超市的千日營運環境,讓大型語言模型(LLM)代理人在定價、補貨、供應商選擇、貨架配置、庫存老化、顧客回饋、外部事件與現金流限制等多重因素下運作。測試七種當代 LLM 於 180 天的表現,結果顯示只有少數模型能完整運作,且與理想的特權策略相比,最優模型在最終淨值與銷售上仍有顯著差距。
深度分析
SimRPD 提出一套三階段流程,先以大型語言模型打造高忠實度的求職者模擬器,產生大量多輪對話資料;再以「意圖鏈」(Chain-of-Intention, CoI) 為基礎的雙層評估機制,從全域分布與單句品質兩方面篩選出高品質合成資料;最後以 SFT 與 PPO 方式微調招聘主動對話代理人。
深度分析
隨著訓練資料逼近上限,UltraX加入插入、刪除與修改三種函式呼叫操作,形成完整編輯空間並以資料自適應提示引導專家LLM產出高品質精煉文本。實驗在五大語料庫使用1B模型,平均效能提升逾2%,且降低所需訓練token,顯示資料效能顯著提升,在實務應用上亦具潛力。
深度分析
研究指出大型語言模型的程式碼自動完成易受後門攻擊,作者提出CodeTracer框架透過行為指紋與語意比對,在僅有錯誤完成事件與微調語料的條件下,成功追溯至惡意樣本,實驗顯示其準確率遠高於既有方法,此技術有望提升開發者對模型供應鏈的可視性,並促使業界加強資料清查與防護機制。
速報
研究針對大型語言模型的預測校準與推理可信度進行探討。透過在中間層激活上訓練表徵池化探測器,顯著提升模型校準度,且能偵測出鏈式思考與實際證據不符的情況。實驗顯示,預測在推理前已基本確定,使用此方法可減少產生代幣量 30%~47% 且不影響準確性。
深度分析
本研究探討Gemini2.5Flash大型語言模型能否在全雙工客服語音代理人中取代人工評分,使用209場雙聲道對話與57段擾動音檔,結果顯示在五項指標上與三位人工評審的相關性相當,兩項略低,唯一一項幾乎無相關。部署時建議對音訊清晰度低於4分的通話交由人工審核,以免排序偏差。
速報
隨著視覺語言模型(VLM)、對話模型(DM)、大型語言模型(LLM)與音訊生成模型(AFM)在各領域的廣泛應用,這些多模態基礎模型往往會不自覺地保留訓練資料中的敏感、受版權保護、偏見或不安全的跨模態關聯。因知識分布於共享表徵,刪除請求或政策更新後的重新訓練成本高昂,且精準遺忘困難。
速報
科學研究常需在前人基礎上演化。IdeaGene-Bench 以 Idea Genome 物件與 GenomeDiff 描述論文譜系,提供 1,961 條金標準追蹤與六種演化動態。測試顯示大型語言模型在譜系推理上僅有 27.3% 精確度,且結構化資訊會重排系統表現。
深度分析
研究以執行驗證方式比較四大前沿 AI 教師,發現模仿訓練未提升程式碼學生,反而以可驗證獎勵的強化學習提升表現,顯示教師合作應聚焦於環境建構。在硬體成本與模型版權爭議下,此研究提供可復現的本地化管線,對開發者與產業具參考價值。此結果也暗示未來 AI 教師的合作模式可能重塑開源社群與商業授權的平衡。
速報
本篇論文屬於認知功能第一原理模型系列,提出一套「主動提升」的數學框架,用以描述思考與感知的過程。研究從可觀測與潛在空間的機率分布提升與投影出發,旨在以神經網路等簡單函數族表示複雜資料分布。作者定義了活化抽樣潛在序列、以最大速率降低不確定性的內在驅動,進而推導出包含慢思考模型的靜態理論子空間。
深度分析
隨著大型語言模型在推理上仍受組合‑知識二分困擾,研究者提出具體化命題提示(CPP),透過四類命題(TP、TN、FP、FN)明確化問題相關斷言,實驗顯示在醫學與數學基準上均超越傳統CoT,提升精確度與穩定性。此外,CPP在不同基礎模型與參數規模上皆表現一致,證明其可擴展性。
深度分析
隨著人工智慧從規則自動化演進至Agentic系統,本文以小型商業保險BOP的全自動承保為例,比較單一大型語言模型、簡易檢索增強生成與多代理AgenticRAG三種管線,結果顯示多代理架構在多步驟與資訊缺失情境下能顯著提升決策正確率與可追溯性。