深度分析
Delta Weight Sync:利用稀疏 Safetensors 降低異步強化學習帶寬需求
DeepSeek近期發表的V4針對長上下文代理工作,使用交錯壓縮注意力與多頭潛在注意力等四項技術,大幅降低KV‑cache與HBM使用。同期,HuggingFace透過DeltaWeightSync以稀疏safetensors檔案同步bf16權重,將每步傳輸量從超過1 GB壓縮至約20‑35 MB,讓異步RL訓練成本大幅下降。此舉預計降低雲端帶寬開銷,促進分散式訓練與開源生態的擴散。
深度分析
DeepSeek近期發表的V4針對長上下文代理工作,使用交錯壓縮注意力與多頭潛在注意力等四項技術,大幅降低KV‑cache與HBM使用。同期,HuggingFace透過DeltaWeightSync以稀疏safetensors檔案同步bf16權重,將每步傳輸量從超過1 GB壓縮至約20‑35 MB,讓異步RL訓練成本大幅下降。此舉預計降低雲端帶寬開銷,促進分散式訓練與開源生態的擴散。
深度分析
在非同步強化學習中,模型權重同步需傳送完整檔案,流量龐大。研究者利用BF16下超過99%權重不變的特性,將變更以稀疏safetensors上傳至HubBucket,Xet去重後每步僅傳數十MB,成本降低近百倍,且訓練與推論可分布於不同雲端。