速報 近正交特徵字典提升語言模型可干預性 機械可解釋性研究認為語言模型的概念以線性特徵呈現在激活空間中,然而特徵交織會導致干擾,使局部干預產生意外影響。研究者受「獨立因果機制」原則啟發,提出將內部特徵約束為近正交,以促進模組化表示並支援因果干預。透過分析特徵字典的自一致性,建立上界以量化干擾傳播,並將其轉化為正交正則化項。