深度分析
AdvNav:黑箱行為導向對抗攻擊提升視覺語言導航模型安全性
隨著具身AI的發展,視覺語言導航系統仍易受視覺擾動影響。研究提出AdvNav以行為導向的黑箱方式,透過雙層粒度回饋與遺傳演化優化擾動,成功干擾多種模型。實驗顯示在R2R測試集上,攻擊成功率最高達87%。此方法不依賴模型梯度,僅利用觀測的行為回饋即可搜尋高效擾動,為評估與強化VLN安全性提供新工具。
深度分析
隨著具身AI的發展,視覺語言導航系統仍易受視覺擾動影響。研究提出AdvNav以行為導向的黑箱方式,透過雙層粒度回饋與遺傳演化優化擾動,成功干擾多種模型。實驗顯示在R2R測試集上,攻擊成功率最高達87%。此方法不依賴模型梯度,僅利用觀測的行為回饋即可搜尋高效擾動,為評估與強化VLN安全性提供新工具。
速報
現有無人機視覺語言任務缺乏長程、細粒度控制。研究推出 FLIGHT 基準,提供多階段指令與 6‑DoF 軌跡標註,並以 FLIGHT VLA 架構結合低頻推理模型與高頻連續控制模型。實驗顯示新系統在多階段完成度與子目標遵循上明顯優於既有基線,提升了飛行推理與控制效能。
深度分析
在視覺語言導航領域,傳統採用自我中心逐步決策,易累積誤差且成本高昂。論文提出NavOne,將導航重新定義為在先建的俯視地圖上一次性全局規劃,直接輸出密集路徑與目標機率圖,並以R2R-TopDown資料集驗證。結果顯示在地圖基礎方法中達到領先表現,同時大幅提速。
HTNav
城市空拍視覺語言導航因物流與檢測需求受關注。HTNav 以混合模仿與強化學習、層級決策與地圖表示提升泛化與長程規劃。實驗在 CityNav 基準上創下全項最佳成績,顯示其在複雜城市環境的導航精度與穩定性顯著提升。