深度分析 公共討論介面注入毒文對大型語言模型預訓練資料的影響與 HalfLife 分析 研究指出,透過公共討論介面注入毒文,可在網路爬蟲與資料篩選後進入大型語言模型的預訓練語料,並以 HalfLife 方法量化其存活機率,顯示此向量足以影響模型行為。研究還發現,僅0.15% 的收錄機率已足以超過維基百科在常見語料庫中的比例,此結果提醒開放式語料庫在安全治理上需重新檢視。