深度分析 保護每個樣本:新型優化器框架「Harm Reduction」降低批次干擾、提升泛化能力 傳統深度學習優化器(如 SGD、AdamW)在更新參數時,會將批次內所有樣本的梯度平均後,再與歷史狀態(如動量)結合。這種做法雖然能穩定訓練,卻可能讓部分樣本的損失不降反升,形成所謂的「傷害」(harm)。