深度分析 利用 Gate‑Zero Growth 於 Transformer 實現零遺忘的增長與函數保留 隨著語言模型規模持續擴大,研究提出Gate‑ZeroGrowth以零門控方式在持續學習中保留函數。該方法透過零初始化門將新殘差塊加入模型,理論保證舊參數不變且新參數在成長點平坦。實驗顯示在300M→857MTransformer上幾乎零遺忘,優於未使用零門控的基線。