速報 iFLYTEK-Embodied-Omni:統一視覺、語言與動作的多模態基礎模型 為提升通用型具身代理人的指令理解與長期控制能力,研究團隊打造 iFLYTEK-Embodied-Omni,採用視覺語言、影片生成與動作生成的共享多模態自注意力架構。模型將高階規劃與低階執行分工協作,並以混合示範影片進行四階段訓練,顯著提升任務執行的準確度與穩定性。
速報 MuSix:具身代理人多尺度世界模型與自適應框架 具身代理人在真實環境中需要隨著情境變化進行多尺度推理與知識調整。研究指出,傳統的專家混合模型在路由與更新上缺乏尺度概念,難以針對不同層級的知識做適切調整。