深度分析
JetBrains 發布 Mellum2:12 B MoE 模型提升文字與程式碼推理效能
JetBrains於2026年6月推出Mellum2,這是一款專為文字與程式碼設計的12 B參數MoE模型。模型每個token僅啟動約2.5 B參數,使推理速度較同規模開源模型提升逾兩倍,且以Apache2.0授權公開。此效能與授權組合有望降低部署成本,加速高頻AI任務。
深度分析
JetBrains於2026年6月推出Mellum2,這是一款專為文字與程式碼設計的12 B參數MoE模型。模型每個token僅啟動約2.5 B參數,使推理速度較同規模開源模型提升逾兩倍,且以Apache2.0授權公開。此效能與授權組合有望降低部署成本,加速高頻AI任務。
深度分析
隨著大型語言模型規模不斷擴張,傳統全副本訓練在跨資料中心的頻寬與記憶體上受限。FoMoE 透過將 MoE 專家層切分、僅同步所屬專家,降低每輪傳輸量並維持效能。實驗顯示其通信成本比傳統方法縮減逾 1.4 倍,此外,系統在保持路由熵與避免專家崩潰方面亦表現穩定,顯示在大規模部署上具備可擴展性。
深度分析
隨著MoE大語言模型在記憶體需求上受限,研究者提出「專家參照」於相鄰層共享FFN權重,同時保留層級路由與注意力。實驗顯示記憶體使用降低近2倍,且困惑度與下游效能幾乎不受影響。在g=4的層組設定下,專家權重共享達到4倍參數壓縮;若將節省的參數再投入擴充中間層的專家數量,亦可在等參數條件下恢復效能。
深度分析
JetBrains於2026年6月推出12億參數的Mellum2MoE模型,針對文字與程式碼工作負載設計。模型每個token僅啟動約2.5億參數,推理速度較同規模開源模型提升超過兩倍,適用於路由、RAG、子代理與私有部署等高頻任務。此效率提升有望降低實務部署成本並推動AI系統模組化發展。
深度分析
NVIDIA於2026年4月發布Nemotron3NanoOmni,多模態模型支援文字、影像、影片與音訊,同時處理長文件與跨媒體推理,測試顯示在文件、視訊與語音基準上均領先,預示企業AI應用將更具效率與安全性。該模型在多模態推理上達到最高9倍吞吐量提升,且支援8GB以上GPU實時部署。
速報
Mixture-of-Experts(MoE)模型因能將輸入導向特定專家而具備高效能擴展能力,但傳統的路由機制僅使用淺層線性投射,對輸入結構感知不足,常導致路由不穩。
深度分析
JetBrains於2026年6月推出Mellum2,12億參數的MoE模型,針對文字與程式碼工作負載設計。模型每個token只激活約2.5億參數,推理速度超過同規模開源模型兩倍。此特性使其在路由、RAG、子代理與私有部署等高頻AI任務上具備成本與效能優勢。
深度分析
研究針對多樣視覺基礎模型的負向傳遞問題,提出PRISM雙流條件化MoE框架,採用教師條件路由於兩階段分解與重組,並加入局部去相關損失防止淺層崩潰,使專家自動分化與動態組合,於PASCAL-Context與NYUD‑v2取得新紀錄,證實稀疏專業化能有效整合異質視覺知識,預示未來多模型蒸餾將走向動態路徑選擇。
深度分析
JetBrains 於 2026 年 6 月發表 Mellum2,這是一款 12 億參數的 Mixture-of-Experts(MoE)模型,專為文字與程式碼工作負載設計。模型在每個 token 只激活約 2.5 億參數,實現超過同規模開源模型兩倍的推理速度,適用於路由、RAG、子代理與私有部署等高頻 AI 任務。
速報
Mixture-of-Experts(MoE)已成為前沿語言模型的主流架構,傳統的生產框架在效能與彈性上投入大量工程資源。為降低新架構與系統優化的開發成本,研究團隊提出以 AI 編碼代理人自動化開發的概念,並以此為基礎打造 PithTrain——一個針對代理人任務效率(ATE)優化的緊湊 MoE 訓練框架。
速報
ArXiv發表LagunaM.1與LagunaXS.2,兩款為長程代理式編碼設計的MoE基礎模型。作者說明在稱為ModelFactory的系統中從頭訓練與量化;M.1與XS.2在軟體工程與終端機基準上與同級開源模型相當,XS.2權重已以Apache2.0釋出。
深度分析
MiniMax發表深度技術報告,回顧M2系列(含M2、M2.5、M2.7)在稀疏Mixture-of-Experts、Grouped Query Attention(GQA)與工程化路徑上的關鍵取捨;