快速辨識大型語言模型拒絕子空間:RFM 演算法突破
研究團隊將遞迴特徵機器(Recursive Feature Machine, RFM)演算法結合探測器初始化,成功在數秒內於推理型與非推理型大型語言模型(如 Qwen 3、Qwen 2.5)中找出多維度的拒絕子空間。相較於傳統子空間抽取方法,RFM 不僅計算效率更佳,且在消融測試中表現更優。
大型語言模型(LLM)的安全與可解釋性需求日增,傳統上假設行為以單一線性方向編碼,但近期研究指出,諸如拒絕回應有害查詢等複雜行為實際上分佈於多維子空間。
RFM 演算法的快速子空間抽取
研究團隊將遞迴特徵機器(Recursive Feature Machine, RFM)演算法與探測器(probe)提供的初始化資訊結合,使其能在數秒內於推理模型(如 Qwen 3)與非推理模型(如 Qwen 2.5)中辨識出拒絕子空間。相較於以往需要大量計算資源的抽取方法,RFM 的計算效率顯著提升。
效能與未來方向
在消融任務測試中,RFM 不僅完成子空間辨識更快,亦展現出優於其他方法的表現。研究者計畫進一步比較不同抽取技術所得到的子空間關係,以驗證其一致性與實用性。若結果持續正向,RFM 有望成為現有子空間抽取方法的低成本、可擴展補充方案。
延伸閱讀
- 安全導向嵌入攻擊 (STEER) 解析:多語言繞過與高效能實驗
- Handlebars 雙大括號 HTML 逃脫對 LLM 結構角色注入的安全性分析
- 基於 WildChat 真實提問的 LLM 資安與隱私需求與模型表現評估
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。