速報
釣魚郵件偵測模型在對抗攻擊下準確率暴跌,研究揭示乾淨資料測試的盲點
釣魚郵件是持續存在的網路安全威脅,機器學習分類器廣泛用於偵測。一項研究比較 TF-IDF 邏輯迴歸與 DistilBERT 模型,兩者在乾淨資料上準確率超過 98%,但在對抗攻擊下分別跌至 64.00% 與 63.64%。結果顯示乾淨資料準確率無法預測對抗穩健性。
速報
釣魚郵件是持續存在的網路安全威脅,機器學習分類器廣泛用於偵測。一項研究比較 TF-IDF 邏輯迴歸與 DistilBERT 模型,兩者在乾淨資料上準確率超過 98%,但在對抗攻擊下分別跌至 64.00% 與 63.64%。結果顯示乾淨資料準確率無法預測對抗穩健性。
深度分析
隨著大型語言模型在臨床應用的增加,評估其醫療安全成為必要。JMedEthicBench 提出首個以日本醫師會67項指引為基礎的多回合醫療安全基準,透過自動化發現七種 jailbreak 策略生成逾五萬組對話,對27款模型進行評測。