深度分析 「EgoSafetyBench」:首個自我視角影片基準評估視覺語言模型即時安全防護能力 隨著視覺語言模型被提議作為家庭與工廠機器人的即時安全守護,研究團隊推出EgoSafetyBench,收錄1,200個機器人視角影片,細分情境與視覺訊號誤導兩軸,測試模型在偵測明顯與情境危險、以及對錯誤標示的反應。結果顯示即使最先進模型也常錯過關鍵危險時刻,且誤導文字會導致過度干預或漏判。