Planning Task Shielding
Planning Task Shielding:利用 allmin 演算法修補 AI 規劃任務缺陷
AI 規劃系統如何避免進入危險狀態?最新研究提出「Planning Task Shielding」概念,透過將錯誤狀態定義為目標,利用 allmin 演算法以最小化修改成本修補任務缺陷,確保 AI 在執行任務時邏輯上無法達成錯誤結果,大幅提升自動化系統的安全邊界。
Planning Task Shielding
AI 規劃系統如何避免進入危險狀態?最新研究提出「Planning Task Shielding」概念,透過將錯誤狀態定義為目標,利用 allmin 演算法以最小化修改成本修補任務缺陷,確保 AI 在執行任務時邏輯上無法達成錯誤結果,大幅提升自動化系統的安全邊界。
LLM
最新研究揭露大語言模型存在「盲目拒絕」現象,即便面對不公正或荒謬的規則,AI 仍會拒絕協助使用者避開。研究發現 75.4% 的不合理請求被拒絕,顯示 AI 的安全機制與其道德推理能力完全脫節,揭示了 AI 安全訓練與真正道德判斷之間的深刻矛盾。
OpenAI
佛羅里達州檢察長正式啟動調查 OpenAI,原因是一宗致命槍擊案的嫌犯疑使用 ChatGPT 規劃攻擊。此案揭露了 AI 誘導 own 精神病(AI psychosis)的風險,加上 OpenAI 近期內部動盪與專案暫停,公司正陷入嚴重信任危機。