深度分析
BOHM — 以路由權重建構多層級歸因樹,評估複合 AI 系統的信任分布
隨著 AI 系統愈來愈仰賴多階層路由與工具調度,傳統以 Shapley 為基礎的歸因方法面臨成本與可評估性的限制。BOHM(Byproduct-of-Hierarchy Method)提出以系統已維護的路由權重直接建構層級歸因樹:葉節點以根到葉路徑權重乘積表徵信任分配,且在每個深度同時給出多解析度的分解。
深度分析
隨著 AI 系統愈來愈仰賴多階層路由與工具調度,傳統以 Shapley 為基礎的歸因方法面臨成本與可評估性的限制。BOHM(Byproduct-of-Hierarchy Method)提出以系統已維護的路由權重直接建構層級歸因樹:葉節點以根到葉路徑權重乘積表徵信任分配,且在每個深度同時給出多解析度的分解。
速報
大型語言模型從雲端移向行動,電力與記憶體成為瓶頸。研究在旗艦 Android 建立可重複流程,量測耗能、延遲與生成品質;發現重要性感知量化雖能縮減記憶體占用但未顯著省電,模型架構才是電池表現關鍵,Mixture‑of‑Experts 提供低能耗下的大容量,並指向中型模型如 Qwen2.5‑3B 的實務折衷價值。
深度分析
研究背景:大型語言模型常以巨型單體方式訓練與部署。核心做法:EMO在預訓練以文件邊界為弱監督,限制同文檔token在共享專家池內路由;同時採用全局負載平衡與隨機文件池大小以避免崩塌。主要影響:小比例專家即可保留接近整體效能,有助降低部署記憶體成本。
速報
DeepSeek 推出兩款 V4 大語言模型,採 mixture‑of‑experts 架構支援百萬 token。V4 Pro 參數達 1.6 兆,成最大開源模型;Flash 參數較少。新模型在推理基準上接近領先商業模型,程式碼表現與 GPT‑5.4 相當,知識測試稍遜。
大佬動態
SimonWillison發布訊號指出DeepSeek推出V4預覽版,兩款均為MixtureofExperts並支援100萬token上下文;Pro採1.6T總參數且49B啟動,Flash為284B總參數與13B啟動,並以MIT授權釋出;此一發布將擴展開放權重與長上下文實驗的可及性,可能影響研究與部署習慣。
深度分析
研究針對 MoE Transformer 的泛化與縮放行為,提出將活化容量與路由組合分離的理論框架,推導出與活化參數預算成正比的度量熵並加入路由開銷,證明在流形資料模型下的泛化界限與密集網路等價,並給予誤差可透過提升活化容量或增專家數量降低的建構性近似結果,最後提出模型、資料與計算的神經縮放律。
TalkLoRA
研究人員提出 TalkLoRA 框架,透過在 MoE-LoRA 結構中加入通訊模組,打破專家之間的獨立性假設,解決路由不穩定與專家主導問題。實驗證明,TalkLoRA 在語言理解與生成任務上優於傳統 LoRA 與 MoE-LoRA,能以更少的參數達成更高的微調效率與更均衡的專家利用率。