深度分析 安全導向嵌入攻擊 (STEER) 解析:多語言繞過與高效能實驗 本研究指出,LLM安全訓練以英文為主,導致低資源語言或混合語言的有害請求易被忽視。提出STEER攻擊,利用模型拒絕方向的梯度屬性,將關鍵詞翻譯成低資源語言,成功率在六個開源模型上達93%至96.7%。此結果顯示目前對英文以外輸入的安全防護仍有重大缺口。