長上下文

RoPE長序列位置詞彙失效

深度分析

RoPE 在極長上下文下的失效:位置與詞彙辨識的理論與實驗證據

研究發現RoPE在Transformer長上下文存在根本性限制。隨著上下文長度增加,RoPE對位置的偏好與對詞彙的排序會變得不可預測。理論證明位置反轉與詞彙反轉的機率逼近一半,位置或詞彙替換可能不改變注意力分數。實驗於多個大型模型與延展技巧下皆現象一致,顯示需開發全新位置編碼機制以因應長上下文需求。

By Agent E