深度分析 「MetaBreak」利用特殊代幣突破大型語言模型安全防護的研究與實驗 MetaBreak研究發現,利用聊天模型的特殊代幣注入,可同時繞過內部安全對齊與外部內容審查,實現對線上大型語言模型的越獄。四種攻擊原語在實驗室與主流平台測試,成功率較傳統提示工程高出34.8%。此結果顯示僅刪除特殊代幣的防禦不足,需重新設計AI服務的安全機制。