随着 Groq 3 LPX 全面量产,NVIDIA 将 Vera Rubin 推理能力延伸至智能体领域

AI 推理的下一个时代,不会由某一款突破性的芯片、网络或系统来单独定义。它的真正标志,在于 AI 工厂各个层级之间的高效协同。正因如此,NVIDIA 正通过扩展 Vera Rubin,为智能体系统提供快速的 Token 生成能力。 NVIDIA 今日宣布,Vera Rubin 机架级系统中的 NVIDIA Groq 3 LPX 已正式全面量产。在 Artificial Analysis 针对开源智能体模型 Gemma 4 31B 进行的基准测试中,在处理对智能体系统至关重要的 10 万 Toke

Aug 27, 2026 - 03:00
 2
随着 Groq 3 LPX 全面量产,NVIDIA 将 Vera Rubin 推理能力延伸至智能体领域

AI 推理的下一个时代,不会由某一款突破性的芯片、网络或系统来单独定义。它的真正标志,在于 AI 工厂各个层级之间的高效协同。正因如此,NVIDIA 正通过扩展 Vera Rubin,为智能体系统提供快速的 Token 生成能力。

NVIDIA 今日宣布,Vera Rubin 机架级系统中的 NVIDIA Groq 3 LPX 已正式全面量产。在 Artificial Analysis 针对开源智能体模型 Gemma 4 31B 进行的基准测试中,在处理对智能体系统至关重要的 10 万 Token 长上下文场景时,Groq 3 LPX 实现了每秒 3,400 个输出 Token 的性能,比目前同类型的平台快了 4 倍。

全球各地的行业合作伙伴正在积极采用 Vera Rubin 平台解决方案。SpaceXAI 宣布将采用 NVIDIA Vera CPU 为其下一代智能体 AI 提供动力。CoreWeave 已将 Spectrum-X 多平面投入生产环境,该系统通过多个并行交换机平面连接 NVIDIA Vera Rubin 机架,提供高带宽、扁平化且无损的 AI 网络。Nebius 是首家采用 NVIDIA Groq 3 LPX 的 AI 云服务商。

随着 AI 的重心从训练转向推理和智能体,推理已成为新前沿。智能体 AI 系统正在生成更多的 Token,处理呈指数级增长的上下文窗口,并越来越多地与其他 AI 系统协作以解决复杂问题。

这些工作负载需要新一代基础设施,不仅要优化性能,还要在前所未有的规模下,针对吞吐量、响应速度和经济效益进行全面优化。

在本周于加利福尼亚州帕洛阿托举行的 Hot Chips 大会上,NVIDIA 展示了极致协同设计如何从端到端重塑 AI 工厂。通过将计算、网络和推理加速整合为统一系统,NVIDIA 正帮助客户构建专为长上下文推理和多智能体系统等新兴需求而量身定制的基础设施。

极致协同设计,实现性能优化

极致协同设计是 NVIDIA 平台的核心设计理念。Vera Rubin 专为加速推理而打造,旨在帮助智能体处理日益增长的长序列推理任务。

NVIDIA Spectrum-X 以太网能够在 AI 工厂内高效传输海量数据,而 NVIDIA Groq 3 LPX 则专为以超快速度生成 Token 而生。两者协同工作,体现了 NVIDIA 如何将上下文处理、通信到生成等 AI 管线的每一个阶段,作为统一、集成的 AI 工厂架构的一部分进行全面优化。

NVIDIA Groq 3 LPX 带来了全新的低延迟推理架构,旨在与最具通用性的 AI 工厂平台 Vera Rubin 系统协同工作,帮助企业和云服务提供商满足智能体应用所需的低延迟、极高吞吐量和可扩展的经济效益。

突破性的性能并非来自对单个组件的独立优化,而是源于对整个技术栈每一层的协同设计。从网络、上下文处理到大规模推理,NVIDIA 全栈平台将 AI 工厂转化为集成的智能引擎,旨在将不断增长的 Token 产出转化为实际收益。



2026 年 8 月 24 日????

NVIDIA 合作伙伴采用 Vera Rubin,实现最低 Token 成本

领先的 AI 云服务商 Nebius 率先采用 NVIDIA Groq 3 LPX,为开发者提供行业领先的 Token 生成速度,以支持快速响应的智能体 AI 应用。

在 Nebius Token Factory 中将 NVIDIA Groq 3 LPX 与 NVIDIA Vera Rubin 系统相结合,将大幅提升推理性能,使开发者能够大规模构建高交互性的智能体、编程系统以及其他实时 AI 体验。

CoreWeave 正在生产环境中部署 Spectrum-X 多平面,用于互连 NVIDIA Vera Rubin 机架,进一步提升其 AI 云基础设施能力。



2026 年 8 月 24 日????

SpaceXAI 采用 NVIDIA Vera CPU 发展智能体 AI

SpaceXAI 计划围绕 NVIDIA Vera Rubin 来构建和扩展其未来的 AI 架构,覆盖范围从地面数据中心延伸至轨道卫星。该公司计划部署 NVIDIA Vera CPU,以加速智能体 AI 背后的 CPU 密集型工作负载,包括任务编排、工具调用、代码执行、数据处理和模拟。

此次与 SpaceXAI 的合作将 NVIDIA 全栈 AI 平台引入 SpaceXAI,整合了 Vera CPU、NVIDIA 加速计算、网络及软件技术,旨在以前所未有的规模推动 AI 的发展。

Vera Rubin 专为智能体时代设计,具备领先的单核性能、卓越的内存带宽以及高负载下的稳定可预测性能。这有助于智能体更快地完成任务,并确保宝贵的 GPU 基础设施保持满载运行。



2026 年 8 月 24 日????

NVIDIA Groq 3 LPX:交互式 AI 推理加速器

NVIDIA Groq 3 LPX 与 Vera Rubin 平台进行协同设计,帮助 AI 工厂以极低延迟为智能体工作负载生成 Token。

智能体 AI 带来了一项全新的性能挑战:解码延迟。当 AI 智能体进行推理、调用工具并与其他系统交互时,它们会以逐个 Token 的形式生成响应,这导致即使是微小的延迟也会在复杂的工作链路中不断累积放大。为了让智能体能够以用户期望的速度流畅运行,NVIDIA Groq 3 LPX 作为 Vera Rubin 平台的扩展,为 Token 生成提供了专用的加速支持。

NVIDIA Rubin GPU 负责大规模上下文处理,而 LPX 则加速延迟敏感型解码工作负载。两者协同实现了更快速、更可预测的 Token 生成,帮助 AI 工厂提供响应更快的推理能力、更流畅的智能体交互以及更高的基础设施效率。

Rubin GPU 与 LPU 的协同设计旨在打破传统架构中速度与吞吐量之间的权衡,帮助 AI 服务商为下一代智能体 AI 应用提供快速响应的大规模推理服务。

打造 Token 工厂

随着行业重心从模型训练转向大规模提供智能服务,基础设施必须向 NVIDIA 所描述的“Token 工厂”演进,能够同时兼顾性能、吞吐量、智能完整性和经济效益。智能体 AI 系统不断与其他 AI 系统交互、访问多个数据源并维持海量上下文,这对快速推理提出了前所未有的需求。

NVIDIA Groq 3 LPX 正是为应对这些工作负载而生。作为 Vera Rubin 系统的扩展,它即使在海量上下文窗口下也能实现极速响应,同时帮助服务商最大化吞吐量和基础设施利用率。

面向推理的极致协同设计

与独立加速器不同,NVIDIA Groq 3 LPX 通过极致协同设计,将 GPU 和 LPU 的优势相结合。Rubin GPU 与 LPU 共同完成 AI 模型的各个层级的计算,为智能体工作负载带来全新水平的推理性能。

在大规模部署中,LPU 集群可作为一个专为确定性推理优化的巨型处理器运行。机架级的 NVIDIA Groq 3 LPX 部署可包含 256 个 LP30 加速器,它们通过片间直连技术相连,打造出一台专为现代 AI 工厂构建的高效推理引擎。

专为智能体 AI 时代设计

随着推理模型的规模不断扩大以及智能体工作流生成的 Token 数量逐渐增长,支撑它们的基础设施也必须不断演进。NVIDIA Groq 3 LPX 通过专为推理打造的架构进一步扩展了 Vera Rubin 平台,旨在最大化响应速度、吞吐量和效率,助力驱动下一代 AI 工厂。

而这仅仅是个开始,当与 Vera Rubin 平台结合时,还将迎来更多的优化、支持更多的模型和更强劲的性能 —— 全新水平的吞吐量与交互体验即将到来。敬请期待。



2026 年 8 月 24 日????

NVIDIA Spectrum-X 多平面:在更扁平、更具可靠性的网络上实现大规模 AI 工厂

随着 AI 工厂规模的持续扩大,网络已成为决定性能的关键引擎。在 Hot Chips 大会上,NVIDIA 重点展示了最新一代硬件加速的 Spectrum-X 以太网架构 —— Spectrum-X 多平面。该架构支持以太网扩展至前所未有的规模,同时避免了因增加额外网络层级所带来的延迟、抖动和成本问题。

NVIDIA Spectrum-X 以太网是一个专为 AI 优化的端到端以太网平台,结合了 NVIDIA Spectrum-X 以太网交换机、SuperNIC 和软件,显著提升基于以太网 AI 基础设施的 AI 工厂和云服务的性能与效率。与通用以太网相比,该平台可将 AI 网络性能提升 1.6 倍,并在多租户环境中提供一致、可预测的性能表现。

多平面:无需增加新层级即可实现大规模扩展

传统 AI 工厂若要突破现有最大集群规模,通常需要增加第三层网络,这会增加延迟、导致性能出现不可预测的下降,并推高布线、光模块和电力成本。Spectrum-X 多平面采用了一种更简单的方法:将每台服务器的网络连接拆分为多个独立的路径或平面 (planes),每个平面各自运行轻量化的两层网络。进而形成了一个扁平、简单的网络,可轻松扩展至 512,000 个 GPU,同时避免了第三层网络带来的额外成本和复杂性。

上述过程是自动完成的。NVIDIA ConnectX SuperNIC 内置专用硬件引擎,负责管理各个平面之间的流量均衡,并在发生故障时立即重新路由。因此,应用程序和软件只需将其视为单一快速、可靠的连接。在八平面拓扑中,即使一个平面发生故障,网络仍能保持约 90% 的总带宽,基于硬件的恢复速度比基于软件多平面负载均衡的恢复速度快了 11 倍。这使得 AI 工厂的产出提升了 1.6 倍。

通过极致协同设计打造

这种可靠性源于 Vera Rubin NVL72 的极致协同设计,涵盖了交换机芯片、SuperNIC 和软件。基于 102.4Tb/s Spectrum-6 以太网 ASIC 的 Spectrum-X SN6000 系列交换机,以及 ConnectX-9 SuperNIC,为每个 GPU 提供高达 1,600Gb/s 的带宽,都是专为 Vera Rubin NVL72 AI 工厂量身定制。Spectrum-XGS 以太网还把这种协同设计延伸至跨数据中心,使多个站点设施能够作为一个统一的 AI 超级工厂运行,并将多站点的 NCCL 集合通信性能提升 1.9 倍。



2026 年 8 月 24 日????

NVIDIA 推出专为智能体 AI 工厂打造的 Scale-In 基础设施,由 BlueField-4 和 DOCA 提供支持

NVIDIA 推出了 NVIDIA Scale-In,这是 NVIDIA AI 网络的第五大支柱,也是专为智能体 AI 工厂打造的全新加速网络基础设施。Scale-In 将专属的加速能力延伸至 AI 工厂安全保障、管理和运营等基础设施服务中。

NVIDIA Scale-In 由 NVIDIA BlueField-4 处理器和 NVIDIA DOCA 软件平台提供支持,并通过 NVIDIA Spectrum-X 以太网连接,将传统的南北向接入网络转化为一个统一的加速基础设施域。

云计算曾为数据中心带来了软件定义网络 (SDN)、可组合性和弹性,使用户、应用、数据和服务能够动态扩展。

智能体 AI 代表着新一代平台级转变。AI 工厂将庞大的加速计算能力与不断增长的用户、应用和自主智能体结合在一起,它们持续不断地与数据、存储和服务进行交互。这彻底改变了支撑 AI 运行的基础设施需求。如今,网络、存储、网络安全和运维必须与 AI 计算同步加速,将软件定义的灵活性与专用硬件加速及全栈协同设计相结合。

NVIDIA Scale-In 提供多租户网络、高性能存储访问、芯片级安全、弹性配置和实时可观测性,同时保持基础设施处理独立于主机计算资源。通过将这些服务作为 AI 工厂的一部分进行加速和协同设计,Scale-In 可使安全、数据访问和运维与 AI 计算同步扩展。最终,为大规模部署和运营智能体 AI 提供了安全、高效且易于管理的共享基础设施。



2026 年 8 月 24 日????

NVIDIA NVLink Fusion:将 XPU 接入 NVIDIA 领先的 AI 平台

NVIDIA NVLink Fusion 将定制芯片引入 NVIDIA 全球领先的 AI 基础设施平台,助力超大规模企业和 AI 原生公司以更高的性能、更强灵活性和更快速度构建半定制 AI 工厂。

随着 AI 模型规模和复杂度持续增长,仅依靠原始算力已无法满足需求。AI 工厂还需要具备高带宽、低延迟的纵向扩展网络、经过验证的机架级架构,以及涵盖供电、散热、管理软件和供应链的完整生态系统。NVLink Fusion 通过将定制 XPU 和 CPU 连接到 NVIDIA 的纵向扩展和横向扩展技术栈,有效应对这些挑战。

该平台包含第六代 NVIDIA NVLink 和 NVLink Switch 等专为纵向扩展而打造的网络,以及 NVLink-C2C 实现 XPU 与 CPU 之间的高能效互连。通过 NVIDIA MGX 生态系统,用户还可以利用经过生产验证的机架设计、组件、制造合作伙伴的解决方案,以及面向分布式计算、解耦工作负载和集群管理的开放、可扩展软件。

通过在统一架构上对基于 GPU 和 XPU 的系统进行标准化,NVLink Fusion 助力将数据中心的建设部署与芯片就绪状态进行解耦。运营方可共用机架空间、网络、散热、供电和管理系统,后续根据供应情况与工作负载需求的变化,灵活调整 GPU 和 XPU 的组合。

NVLink Fusion 将 NVIDIA AI 平台纵向整合、横向开放的理念延伸至定制芯片领域。合作伙伴能够在自身差异化领域自由创新,同时可以借助 NVIDIA 在计算、网络、基础设施和软件方面的技术,打造出任何单一企业都无法独立构建的灵活、统一的 AI 工厂。

Jat AI Stay informed with the latest in artificial intelligence. Jat AI News Portal is your go-to source for AI trends, breakthroughs, and industry analysis. Connect with the community of technologists and business professionals shaping the future.