深度分析
Athena-Brain-8B 四階段後訓練:80 億參數模型如何讓機器人兼具通用推理與專業決策
大型語言模型體積龐大,難以用於機器人即時決策。Athena-Brain-8B 透過通用微調、強化學習、具身專家訓練與模型合併四階段後訓練,在 80 億參數內同時保留通用智慧與具身技能。實驗顯示,它在機器人導航任務上超越 GPT-5.5 等大模型,證明緊湊模型可勝任機器人大腦。
深度分析
大型語言模型體積龐大,難以用於機器人即時決策。Athena-Brain-8B 透過通用微調、強化學習、具身專家訓練與模型合併四階段後訓練,在 80 億參數內同時保留通用智慧與具身技能。實驗顯示,它在機器人導航任務上超越 GPT-5.5 等大模型,證明緊湊模型可勝任機器人大腦。
深度分析
一項研究在 AppWorld 基準上比較模型合併與聯合多任務強化學習,發現合併後的專家模型在任務目標完成率上與聯合訓練模型無統計差異。任務向量幾何分析顯示專家向量近乎正交,導致支援集或符號合併方法退化為均勻平均。結果表明在該設定下合併足以匹敵聯合訓練,但需注意指標敏感性。
深度分析
隨著大型語言模型訓練成本攀升,分散式低通信方法 DiLoCo 透過本地多步更新降低通訊,但隨著工作節點與本地步數增加,效能會退化。研究將模型合併技術引入 DiLoCo,利用 Iso‑C 及其改良版 IsoLoCo 取代簡單平均,實驗顯示在多工作者設定下顯著縮小與全同步資料平行訓練的差距。
深度分析
多任務微調需精準權重分配,研究提出利用貝葉斯模型合併快速預覽不同權重組合,透過參數平均與更彈性後驗分布提升預測品質,實驗在視覺與語言Transformer上證明可選出更佳權重,提升最終微調效能。此方法亦可擴展至其他大型模型,預計將加速多任務學習的商業化部署與研究迭代。
速報
背景:深度學習通常把模型獨立處理。作者主張在權重空間合併網路:單一任務以C2M3對齊參數,多任務以任務向量和TSV分解減低干擾,並以MASS路由和MERGE3節省評估成本。主要結果:建立理論與演算法基礎,促成已學習能力的組合與重用。可降低評估與部署摩擦。
深度分析
在大模型壓縮與效能維持的挑戰下,研究提出 Branch‑Merge 蒸餾流程,先以領域微調產生專精學生模型,再合併以跨域知識傳遞。實驗顯示 TinyR1‑32B‑Preview 在數學、程式與科學基準上分別提升 5.5、4.4、2.9 分,且與原教師模型表現相近。此技術有望降低部署成本並推動開源大語言模型發展。