深度分析
SMMD:平滑最大均值差異提升大型語言模型數值預測精準度
研究指出大型語言模型在數值輸出上仍不可靠,原因在於傳統交叉熵忽視數值的度量結構。作者提出 SMMD 搭配距離核與圖平滑正則,將預測分布與目標對齊並減少局部誤差。實驗顯示在四項數值任務上,準確率均優於傳統損失,提升顯著。此方法有望推動 AI 數值推理向可驗證與可解釋方向發展,提升金融與科學應用的可靠性。
深度分析
研究指出大型語言模型在數值輸出上仍不可靠,原因在於傳統交叉熵忽視數值的度量結構。作者提出 SMMD 搭配距離核與圖平滑正則,將預測分布與目標對齊並減少局部誤差。實驗顯示在四項數值任務上,準確率均優於傳統損失,提升顯著。此方法有望推動 AI 數值推理向可驗證與可解釋方向發展,提升金融與科學應用的可靠性。
深度分析
本文改寫自 ArXiv 提案,指出標準自注意力裡的全域 softmax 會在層疊運算中促成向量過度同步,進而出現表示塌陷與注意力匯聚現象。作者提出 Krause Attention:以查詢–鍵距離取代點積相似度,透過 RBF 核、有限信任半徑與局部 top‑k 稀疏化約束互動,促成多群簇化而非全域共識。