速報
LLMbda:以來源追蹤防護大型語言模型代理的新型 Lambda 計算模型
隨著大型語言模型被廣泛用作代理,會面臨提示注入等安全風險。傳統防護多依賴雙模型架構與資訊流控制,卻難以保證完整性。研究團隊提出 LLMbda,一種未型別的 call‑by‑value lambda 計算模型,將來源追蹤、動態資訊流與隔離策略內建於語言層,並以 Lean 完成機器檢驗的安全性證明。
速報
隨著大型語言模型被廣泛用作代理,會面臨提示注入等安全風險。傳統防護多依賴雙模型架構與資訊流控制,卻難以保證完整性。研究團隊提出 LLMbda,一種未型別的 call‑by‑value lambda 計算模型,將來源追蹤、動態資訊流與隔離策略內建於語言層,並以 Lean 完成機器檢驗的安全性證明。
速報
大型語言模型在複雜推理任務中常面臨對齊挑戰,傳統 DPO 框架因缺乏對多步驟解答的細粒度反饋而受限。研究團隊推出 HiPO 分層偏好優化技術,將回應拆分為查詢澄清、推理步驟與答案區段,並對各段獨立計算損失函數以進行針對性訓練。實驗證明,HiPO 能在維持訓練穩定性的同時,顯著提升 7B 模型在數學基準測試中的表現與邏輯一致性。
速報
大型語言模型在逆向工程的應用持續擴大,但編譯最佳化使二進位與原始碼對齊變得不可靠。研究提出 Reforge 管線,從 C 原始碼經 DWARF 解析到反編譯,建立函式層級真實值,並以八層信心篩選。測試顯示高信心函式比例隨最佳化下降,未考慮此因素會高估模型效能。
速報
近期 GPU 代工以 FP8 低精度算術提升 FLOPs,但大型推薦模型(LRM)因數值敏感、矩陣乘法與正規化比例高,直接使用 FP8 常導致品質下降與訓練時間延長。
速報
機械可解釋性研究認為語言模型的概念以線性特徵呈現在激活空間中,然而特徵交織會導致干擾,使局部干預產生意外影響。研究者受「獨立因果機制」原則啟發,提出將內部特徵約束為近正交,以促進模組化表示並支援因果干預。透過分析特徵字典的自一致性,建立上界以量化干擾傳播,並將其轉化為正交正則化項。
速報
可分離表徵學習常因缺乏監督而難以捕捉真實資料語意。XFactors 以弱監督 VAE 結合資訊瓶頸,將表示拆解為殘差與因子子空間,利用 InfoNCE 使同因子緊密、不同因子分離,並以 KL 正則化維持結構。實驗顯示在多資料集上達到最佳可分離分數,且在 CelebA 上成功實現因子交換,具備良好可擴展性。
速報
研究團隊推出 RetailBench,模擬單店超市的千日營運環境,讓大型語言模型(LLM)代理人在定價、補貨、供應商選擇、貨架配置、庫存老化、顧客回饋、外部事件與現金流限制等多重因素下運作。測試七種當代 LLM 於 180 天的表現,結果顯示只有少數模型能完整運作,且與理想的特權策略相比,最優模型在最終淨值與銷售上仍有顯著差距。
速報
研究針對大型語言模型的預測校準與推理可信度進行探討。透過在中間層激活上訓練表徵池化探測器,顯著提升模型校準度,且能偵測出鏈式思考與實際證據不符的情況。實驗顯示,預測在推理前已基本確定,使用此方法可減少產生代幣量 30%~47% 且不影響準確性。
速報
大型語言模型在全球廣泛使用,但過度反映西方價值,限制了其對多元文化的代表性。研究團隊基於 Integrated Values Survey(涵蓋 92 個國家)打造 PLURAL,透過兩階段生成流程,將調查回應轉換成約 50 萬筆合成偏好三元組,保留原始價值訊號且呈現真實情境。
速報
研究發現 AI 編碼代理人產出的 Pull Request 在 GitHub 上被審查較少、合併更快、討論也較少;但不同分析方式會使趨勢相反,顯示表面變化不等於原因。研究者從大量技術部落格與 Reddit 討論中抽樣,建構因果模型,指出程式碼審查是 AI 影響軟體的關鍵控制點,最終效果仍由團隊專業與審查流程決定。
速報
隨著視覺語言模型(VLM)、對話模型(DM)、大型語言模型(LLM)與音訊生成模型(AFM)在各領域的廣泛應用,這些多模態基礎模型往往會不自覺地保留訓練資料中的敏感、受版權保護、偏見或不安全的跨模態關聯。因知識分布於共享表徵,刪除請求或政策更新後的重新訓練成本高昂,且精準遺忘困難。
速報
科學研究常需在前人基礎上演化。IdeaGene-Bench 以 Idea Genome 物件與 GenomeDiff 描述論文譜系,提供 1,961 條金標準追蹤與六種演化動態。測試顯示大型語言模型在譜系推理上僅有 27.3% 精確度,且結構化資訊會重排系統表現。