Meta 發布 Muse Spark 大型語言模型:安全評估顯示風險可控
Meta 最新開發的大型語言模型 Muse Spark 於 Advanced AI Scaling Framework 下完成多項安全評估,涵蓋化學、生物、資安與失控風險。評估顯示,在未加防護前化學與生物能力屬高風險,但透過多層緩解措施後,風險降至可接受範圍,且模型在危險工作流的拒絕表現達到業界最佳。
Meta 針對 Muse Spark 完成全方位安全評估
Meta 最新的大型語言模型 Muse Spark 已在公司自訂的 Advanced AI Scaling Framework 內完成風險評估。評估重點聚焦於化學、生物、資安與失控四大災難性風險領域。
在未實施防護前,化學與生物相關能力被判定為「高風險」等級。Meta 隨即部署多層次緩解措施,包括資料過濾、行為監控與安全指令集,並重新測試模型。
經過緩解後,Muse Spark 在化學與生物危險工作流的拒絕表現達到業界領先水準,能有效拒絕涉及危險實驗的指令。
除上述災難性風險外,Meta 亦審視了模型的內容安全與行為特徵,確認其在更廣泛的應用情境中仍維持可接受的風險水平。
最終,Meta 宣布以 Muse Spark 作為 Meta AI 的底層模型正式上線,並持續監測其運行表現。
延伸閱讀
- IRIS:以 Rényi 散度與自適應 α 調度優化自我對弈微調
- Absorber LLM 在 LLaMA2-7B 上以因果同步實現長序列參數記憶
- 解碼器型 Transformer 在符號推理的嵌入崩潰:複製注意力與嵌入管理的三重解法
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。