NVIDIA 在 SIGGRAPH 上展示代理式 AI 与物理 AI 成果,推动图形与仿真技术进步
今年的 SIGGRAPH 大会将持续到 7 月 23 日 (星期四) 在洛杉矶举行,参会者可以了解领先的图形研究、神经渲染、仿真和 AI 如何改变人们和机器创造和理解世界的方式。 NVIDIA 主题演讲于太平洋时间 7 月 20 日 15:45 举行,NVIDIA AI 研究和工程团队负责人 Neil Ashton、Edward Liu 和 Ming-Yu Liu 讨论了由 AI 构建的神经渲染技术、世界模型和 AI 仿真方法。 请继续阅读,了解 SIGGRAPH 大会的最新动态,NVIDIA
今年的 SIGGRAPH 大会将持续到 7 月 23 日 (星期四) 在洛杉矶举行,参会者可以了解领先的图形研究、神经渲染、仿真和 AI 如何改变人们和机器创造和理解世界的方式。
NVIDIA 主题演讲于太平洋时间 7 月 20 日 15:45 举行,NVIDIA AI 研究和工程团队负责人 Neil Ashton、Edward Liu 和 Ming-Yu Liu 讨论了由 AI 构建的神经渲染技术、世界模型和 AI 仿真方法。
请继续阅读,了解 SIGGRAPH 大会的最新动态,NVIDIA 和合作伙伴将展示:
SIGGRAPH 主题演讲:NVIDIA 勾勒图形与物理 AI 的新时代蓝图

NVIDIA AI 研究与工程团队负责人今天在 SIGGRAPH 大会上登台,分享了神经渲染、世界模型和仿真方面的最新进展。这些技术正在改变各个领域创建和使用数字世界的方式,并可应用于创意工具、工业设计、机器人和自主系统。
NVIDIA 创始人兼首席执行官黄仁勋在开场视频中表示:“创作者和设计师需要足够强大的工具来拓展他们的想象力,需要足够灵活的工具来自由地塑造想法,也需要足够精确以实现他们的愿景。无论是用于游戏、电影、机器人还是工厂数字孪生,目标始终一致:打造具备与现实物理世界同等保真度和真实感的虚拟世界。”
NVIDIA 应用深度学习研究主管 Edward Liu 首先展示了 3D 引导神经网络渲染。
他分享了 NVIDIA 在神经渲染方面的最新进展,以及这些技术如何解决三大关键研究挑战:保留艺术创作的意图、确保输出在帧与帧之间的时间稳定性,以及实现 4K 内容实时渲染。
Edward Liu 表示:“控制艺术创作方向对我们来说是一个非常令人兴奋的研究方向。仿真定义了世界,生成丰富了它的外观,而艺术家则主导最终的结果。AI 正在扩展图形学,就像可编程着色器和光线追踪曾经扩展图形学的方式。”
NVIDIA 杰出工程师 Neil Ashton 介绍了 AI 物理领域的创新,包括天气预报、汽车空气动力学、散热设计等方面的应用。
在气候和天气研究中 NVIDIA Earth-2 开放模型系列使科学家能够利用基于模拟数据训练的 AI 模型,将模拟分辨率提升到新的水平,同时实现与传统方法相同或更高的准确性。

Ashton 说:“我们面临的挑战是如何将这些 AI 模型在天气和气候领域取得的成功应用到我们生活的世界中,从而能够设计出未来的飞机、汽车和数据中心。NVIDIA 关注的事情之一就是帮助实现这一愿景。”
Ashton 分享了 NVIDIA 研究中心及其合作伙伴开发的最新模型架构如何将模型 Checkpoint 压缩至数百 MB,这种百万倍量级的压缩能够在一秒内完成符合物理规律的精准可视化。
NVIDIA Cosmos 实验室副总裁 Ming-Yu Liu 分享了 NVIDIA Cosmos,这是一个用于加速物理 AI 系统开发的世界基础模型平台。
他说:“基础模型之所以被称为基础模型,关键在于它能够处理大量不同的数据。我们使用数据训练 Cosmos 执行各种物理任务,包括理解世界、预测、模拟和行动。我们使用一个主干网络解决所有不同的任务。”
Ming-Yu Liu 还介绍了用于帮助 NVIDIA Cosmos 3 实现全局理解的 Mixture-of-Transformers 模型架构。这种能力可实现符合物理规律的结果,适用于人形机器人、抓手或智能汽车等不同具身形态。
他说:“每个具身都有不同的语言,而我们的解决方案是建立一种通用的体系。”
NVIDIA Cosmos 包含一系列不同规模的开放模型,可支持开发者在各种部署用例下使用。今天发布的最新版本是 Cosmos 3 Edge,这是一个拥有 40 亿参数的模型,可在设备上实时运行。
Ming-Yu Liu 还宣布推出了 Cosmos-Dreams,这是一个闭环模拟器的集合,现场他和同事演示了一个专为智能汽车构建的模拟器,该模拟器可在单帧上生成整个世界,并在单张 NVIDIA RTX PRO GPU 上运行。
开发者可以使用 Cosmos-Dreams 验证其模型的准确性,然后再将其部署到实际车队中,或者使用它在现实世界中难以创建的 AI 生成场景中训练模型,从而在节省运营成本的同时加速开发。
观看完整主题演讲并详细了解 Cosmos 3 Edge。
NVIDIA Cosmos 3 Edge 现已推出,将前沿世界模型引入边缘 GPU 以实现本地物理 AI
物理 AI 系统依赖世界模型来感知、推理和预测物理环境。但现实世界十分广阔、无法预测且瞬息万变。
无论是导航仓库的机器人,还是观测工厂车间的摄像头网络,物理 AI 系统都需要理解当前状况,推断接下来可能发生的事情,并迅速采取行动以产生影响。到目前为止,在边缘端交付此类前沿 AI 通常意味着需要牺牲模型能力来换取部署效率。
现已推出的 NVIDIA Cosmos 3 Edge 有助于消除这种权衡。这款拥有 40 亿参数的全模态模型已进行优化,可在 NVIDIA Jetson、NVIDIA RTX PRO 和 NVIDIA DGX 系统,以及 GeForce RTX GPU 上实现内存高效部署和高吞吐量。
作为 NVIDIA Cosmos 3 的扩展,这款紧凑型世界基础模型能够理解并生成文本、图像、视频、环境声音和动作。其 Mixture-of-Transformers (MoT) 架构支持在设备上使得基于物理基础的实时视觉分析和机器人动作成为可能。
Cosmos 3 Edge 在边缘端提供前沿物理 AI —— 在同级别参数模型中,其视觉分析成功率在 VANTAGE-Bench 中排名第一,并通过后训练实现了先进的机器人学习。
跨机器人、智能汽车和智能基础设施的设备端物理 AI
开发者可以使用 NVIDIA DGX Station 台式 AI 超级计算机,利用专有机器人和传感器数据对 Cosmos 3 Edge 进行后训练,从而构建专用世界动作模型,然后将其部署在 NVIDIA Jetson Thor 上,以实现包括操作或移动在内的实时机器人管理策略。Agile Robots、斗山机器人、西门子和 Skild AI 等合作伙伴正在评估 Cosmos 3 Edge 在机器人工作流中的应用。
对于智能汽车,Cosmos 3 Edge 可在资源受限的硬件上实现道路场景理解、交通推理、物体意图预测和策略模型蒸馏。该模型可用作学生主干网络,适用于汽车策略模型蒸馏,可与 NVIDIA Alpamayo 视觉语言动作模型结合使用。
在智能基础设施领域,Cosmos 3 Edge 凭借在 Jetson Thor 上进行的实时推理,为视觉智能体提供了业界领先的吞吐量和准确性。这些智能体能够跨实时视频流进行推理,用于交通监测、公共安全、物流和工业检测。开发者还可以在 NVIDIA Jetson Orin 8GB 上独立运行由 NVIDIA Nemotron 驱动的 20 亿参数推理模块。Centific、Vaidio 和 YUAN 正在评估 Cosmos 3 Edge,以加速在边缘运行的视觉智能体。
Cosmos 平台现已开放获取
Cosmos 3 Edge 是用于开发物理 AI 世界模型的更广泛的 NVIDIA Cosmos 平台的一部分。随着 Cosmos 3 推出 Edge (4B)、Nano (16B) 和 Super (64B) 三种规模,开发者可以为从边缘部署到高保真生成的开发的各个阶段选择合适的模型。
Cosmos 3 Edge、Cosmos 3 Nano 和 Cosmos 3 Super 现已在 Hugging Face 上发布,其推理和后训练框架及方法已在 GitHub 上提供。