深度分析 利用 Activation Refusal‑gap 與 Weight‑recovery Energy 辨識去審查 AI 模型 針對開源 AI 模型被移除拒絕機制的現象,研究人員開發出一套雙信號稽核機制。該技術結合激活間隙與權重恢復能量,在部署前即可分析模型權重,而非僅依賴生成結果。實驗顯示此方法在區分去審查模型與良性微調模型時 AUROC 達 0.95,能有效協助平台在部署前進行快速篩選,但仍面臨偽造基準模型等對抗性風險。