Cosmos 3 全方位世界模型:統合語言、影像、視訊、音訊與行動的突破
NVIDIA 推出 Cosmos 3 全方位世界模型,能同時處理文字、影像、視訊、音訊與動作序列,採用混合變換器架構,支援彈性輸入輸出配置。實驗證明其在多項任務上創新表現,並在開源文字轉影像、影像轉視訊以及機器人政策測試中獲最高排名,推動實體 AI 研究與部署。
全方位世界模型的誕生
Cosmos 3 是 NVIDIA 於近期發表的全方位(omnimodal)世界模型系列,旨在於同一架構內同時處理與產生文字、影像、視訊、音訊與行動序列。模型採用混合變換器(mixture‑of‑transformers)設計,允許高度彈性的輸入與輸出配置,讓視覺語言模型、視訊生成器、世界模擬器與行動模型等功能得以統一。
實驗結果與排名
在一系列理解與生成任務的測試中,Cosmos 3 均刷新了現有的最佳表現,證明全方位世界模型具備可擴展且通用的骨幹能力。根據 Artificial Analysis 的評比,Cosmos 3 的後訓練模型在開源文字轉影像與影像轉視訊領域排名第一;同時在 RoboArena 的政策模型測試中亦獲得最高分。
開源與授權
為加速實體 AI 的開放研究與應用部署,NVIDIA 將程式碼、模型檢查點、精選合成資料集與評測基準全部公開,採用 Linux Foundation 的 OpenMDW‑1.1 授權。相關資源可於 GitHub 與 Hugging Face 取得,專案網站則位於 NVIDIA Research。
延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。