深度分析
184M 參數擊敗 8B 模型:Semalith v1.4 以三軸安全分類器實現即時提示注入偵測
現有開源安全分類器多僅專注單一軸線,Semalith v1.4 以 184M 參數的 DeBERTa-v3-base 架構,在單次推論中同時偵測提示注入、一般危害與金融法規違規。對比 8B 的 Llama-Guard-3,參數量僅 1/44,卻在 7 項提示注入基準全勝,且良意提示誤報率為零。
深度分析
現有開源安全分類器多僅專注單一軸線,Semalith v1.4 以 184M 參數的 DeBERTa-v3-base 架構,在單次推論中同時偵測提示注入、一般危害與金融法規違規。對比 8B 的 Llama-Guard-3,參數量僅 1/44,卻在 7 項提示注入基準全勝,且良意提示誤報率為零。
Schwartz價值
研究針對政治文本中對Schwartz基本價值的句級偵測進行系統性比較,測試句子、局部窗以及全文輸入,並採用人工整理的道德知識庫做檢索擴充。結果顯示:對受監督編碼器而言,全文上下文能帶來明顯效益;對零次學習大型語言模型則未必一致;而早期融合檢索知識對多數設定都有幫助,模型放大亦非必然收益。