深度分析 COMET:結合物件因果注意力與蒙特卡羅樹搜尋的 Transformer 世界模型 研究針對高維視覺環境提出COMET,以凍結的物件編碼器與transformer世界模型結合,利用動作-槽融合與因果注意力聚焦關鍵物件,於八項基準任務中顯著提升樣本效率。在多樣化的視覺控制與機械臂操作任務中,COMET的平均正規化分數超過傳統單一嵌入與其他物件導向基線。