華為昇騰 NPU SuperPOD 助攻 DeepSeek-V4 後訓練,MFU 飆升 2.93 倍
華為昇騰 NPU SuperPOD 針對 DeepSeek-V4 模型家族開發階層式最佳化框架,實現 34.22% MFU,較開源基線提升 2.93 倍。團隊進一步建立 CPT 與 SFT 流程,最終模型零樣本 Pass@1 達 71.81%,超越 GPT-5.4-Mini 與基礎模型。
大規模混合專家(MoE)模型的全參數後訓練,向來是分散式訓練系統的硬仗——記憶體壓力、通訊延遲、核心執行效率等問題層層疊加。華為研究團隊近日發表報告,展示在昇騰 NPU SuperPOD 基礎架構上,針對 DeepSeek-V4 模型家族進行端到端最佳化的成果。
階層式最佳化框架
團隊開發的框架涵蓋三個層次:模型層級的平行度策略、計算與通訊的排程協調,以及底層核心執行最佳化。最終系統達到 34.22% 的模型 FLOPs 利用率(MFU),較開源基線提升 2.93 倍,且訓練穩定性未受影響。
領域專精模型:SLAI T-Rex
在此基礎上,團隊進一步建立連續預訓練(CPT)與監督式微調(SFT)工作流程,專注於複雜的作業研究(OR)任務。他們將整合後的框架稱為 SLAI T-Rex,並以 DeepSeek-V4-Flash 為基礎,建構 OR 導向的資料管線,結合領域資源與求解器驗證的合成最佳化文件。
最終資料集包含 10K 高品質 SFT 樣本,涵蓋四大任務類別與三種問題表示法。專精模型在零樣本 Pass@1 平均得分達 71.81%,超越 GPT-5.4-Mini 與基礎 DeepSeek-V4-Flash 模型分別 3.98 與 11.27 個百分點。
從基礎設施到應用落地
這項研究展示了一條從高效參數後訓練到領域專精模型的完整路徑,為華為昇騰生態在大型語言模型領域的競爭力提供技術佐證,也為求解器導向的數學建模應用開闢新方向。
延伸閱讀
- BTF-2:以離線封存語料與 ReAct 代理人評估戰略推理能力
- Hindsight Preference Optimization:以事後偏好信號(DPO)強化VLM於金融時間序列諮詢
- 自相關影響 Hessian 條件數,導致 KANs 頻譜偏好 — DCT-KAN 的實驗與分析
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。