XPU 如何满足世界级 AI 工厂的需求

为了大规模生成智能,AI 工厂需要持续运行,其经济效益由交付的输出决定:每秒 Token 数、每瓦特 Token 数、每 Token 成本、利用率和正常运行时间。 这需要将 AI 基础设施作为完整的工厂来设计和构建,而不是简单地将加速器堆积在一起。 构建定制 XPU 的超大规模企业和 AI 原生公司不仅要考虑 XPU 本身的设计,还要考虑整个 AI 平台的设计和开发,包括纵向扩展和横向扩展网络、整机架方案、生产工厂软件以及强大的供应商生态系统。 面对 AI 工厂规模需求,这条路径既复杂又昂贵,成

Aug 26, 2026 - 06:00
 3
XPU 如何满足世界级 AI 工厂的需求

为了大规模生成智能,AI 工厂需要持续运行,其经济效益由交付的输出决定:每秒 Token 数、每瓦特 Token 数、每 Token 成本、利用率和正常运行时间。

这需要将 AI 基础设施作为完整的工厂来设计和构建,而不是简单地将加速器堆积在一起。

构建定制 XPU 的超大规模企业和 AI 原生公司不仅要考虑 XPU 本身的设计,还要考虑整个 AI 平台的设计和开发,包括纵向扩展和横向扩展网络、整机架方案、生产工厂软件以及强大的供应商生态系统。

面对 AI 工厂规模需求,这条路径既复杂又昂贵,成为 XPU 快速推向市场的根本性障碍。

打破这一限制意味着要将定制 XPU 与经过验证、成熟可靠的基础架构相结合,使建造者能够将创新重点放在最重要的地方,同时利用已有的技术解决其他问题。

NVLink Fusion 正是为满足这种需求而打造,将 XPU 连接到 NVIDIA 领先的 AI 基础设施,为半定制 AI 算力工厂提高性能、加快上市速度并降低风险。

通过高速纵向扩展释放 XPU 性能

对于运行万亿参数模型,混合专家模型 (MoE) 和代理式 AI 等现代工作负载,如果纵向扩展网络性能无法满足需求,利用率就会显著下降,每 Token 成本也会上升。

纵向扩展网络解决方案必须在以下三个关键维度上表现出色:

  • 交付性能:端到端网络性能、网络计算和成熟的软件集成。
  • 工厂可靠性:高正常运行时间、持续的状态监控和遥测,以及工厂持续运行期间的组件级可维护性。
  • 平台成熟度:通过使用成熟的技术堆栈降低运营风险,这些技术堆栈在大规模部署方面拥有良好的记录,并实现了投资回报。

例如,NVLink Fusion 将 XPU 引入 NVIDIA NVLink 纵向扩展互连域。第六代 NVLink 提供领先的高带宽、低延迟网络实现 72 个 XPU 的互连域。与基于通用以太网的替代解决方案相比,XPU 到 XPU 传输的端到端延迟降低至三分之一,数据包速率提高 10 倍。

NVLink Fusion 还包含 NVIDIA NVLink-C2C 技术,可将 XPU 连接到 NVIDIA Vera CPU 或其他生态系统 CPU,能效最高可达 PCIe 接口的 6 倍,显著减少代理式 AI 系统在控制和计算之间的性能瓶颈。

经过验证的堆栈和生态系统,助力开发和部署

开发定制 XPU 的团队往往面临将 XPU 创新成果转化为数据中心部署所需工作量和复杂性的巨大挑战。其中包括:

  • 集成高速 CPU 和纵向扩展接口
  • 采购并验证纵向扩展网络解决方案
  • 设计计算托盘和交换机托盘
  • 设计和验证整机架方案,包括散热和供电系统
  • 集成安全与存储
  • 管理复杂的供应商生态系统

理想的平台应能提供上述所有这些功能,使团队能够专注于关键的技术创新,在其余部分则采用经过验证的成熟方案。

NVLink Fusion 为快速开发、集成和部署提供了生态系统支持,涵盖 ASIC 设计、CPU 以及 IP 和光互连合作伙伴。

英特尔数据中心芯片工程副总裁兼总经理 Tim Wilson 表示:“NVLink Fusion 让客户能够自由选择最能满足其工作负载需求的 CPU 架构、性能水平和软件功能。”

采用 NVLink Fusion 的用户可以无缝使用 NVIDIA MGX 机架级方案,以及与 MGX 系统相同的供应链。制造合作伙伴负责设计和集成,MGX 供应商则提供机架、散热、供电以及新兴的 800 VDC 等基础组件

QCT 和 Quanta Computer 的产品和解决方案负责人 Jack Luoh 表示:“对 Vera RubinNVL72,我们可以看到,生产线上的系统构建已实现近乎 100% 的自动化。如果 XPU 采用 NVLink Fusion,这些投资中的大部分都可以无缝利用。”

借助基础设施标准化管理风险

AI 工厂的规划无需等待芯片准备就绪才启动。电力采购、设施设计、冷却系统、机架布局和网络架构早在最终加速器组合可用之前就可以开始了。受限于单一芯片选择的数据中心可能会面临进度延误的风险。

不同的工作负载可能适合不同的加速器,包括 XPU、GPU、CPU 和 LPU。GPU 系统可以与半定制系统协同运行,用于训练、后训练、推理、检索和服务。

MediaTek 企业高级副总裁兼数据中心和计算事业部总经理 Vince Hu 表示:“NVLink Fusion 计划的价值在于客户可以先采用 NVIDIA GPU 部署其机架级解决方案,然后再将 XPU 的开发解耦,并以不同的节奏开发。”

NVLink Fusion 通过统一的架构解决了这些挑战。基于 XPU 和 GPU 的系统,例如 Vera Rubin NVL72,可以共用机架空间、网络、冷却、供电和管理系统。运营商可以在尚未确定芯片组合的同时进行扩容,然后根据工作负载需求、芯片供应和业务优先级的变化重新调配容量。

GUC 主席兼首席战略官 Lie-Szu Juang 表示:“NVLink Fusion 让超大规模企业或定制 ASIC 设计商集成自有的定制 CPU 或 XPU,并将 NVIDIA 技术与第三方流程相结合,从而构建统一的机架级架构。”

为 AI 工厂进行设计、验证和运营

AI 工厂建设成本高昂,一旦出错可能需要付出昂贵的代价返工。基础设施必须在开始施工之前完成验证。NVLink Fusion 与 NVIDIA DSX AI 工厂参考架构保持一致,实现建筑、供电、冷却、计算和网络的协同设计。NVIDIA Omniverse DSX AI 工厂 Blueprint 为十亿瓦级 AI 工厂提供了数字孪生及开放参考设计,助力合作伙伴能够在正式部署前同步对设施和技术进行建模。

在机架层面,可维护性也是性能的一部分。参考计算托盘采用 100% 液冷技术,无风扇、无电缆且无软管,并且支持单托盘拔出维护,机架其余部分仍可正常运行。NVLink Switch 托盘同样采用液冷设计,支持在服务期间持续运行。

亚马逊公司 Annapurna Labs 高级硬件开发经理 CC Lee 表示:“借助 NVLink Fusion,我们可以使用经过验证的 NVL72 机架设计来缩短产品上市时间,并且可以对接多个供应商,帮助我们将更多产品交付给客户。

软件是 AI 工厂的能力底座。用于分布式工作负载的 NVIDIA NCCL、用于资源解耦的 NVIDIA Dynamo 和 NIXL,以及用于集群管理、遥测和调试的 NVIDIA Mission Control 可帮助运营商将异构 AI 基础设施作为协同系统运行。

借助 NVLink Fusion,XPU 现在可以对接业界领先的 AI 平台,助力超大规模企业和 AI 原生公司构建统一的半定制 AI 工厂。这种模式汇聚众多厂商的优势,打造出凭单一企业无法实现的基础设施。

详细了解 NVLink Fusion

Jat AI Stay informed with the latest in artificial intelligence. Jat AI News Portal is your go-to source for AI trends, breakthroughs, and industry analysis. Connect with the community of technologists and business professionals shaping the future.