NVIDIA Nemotron 3.5 Lightning 和 NeMo Switchyard 助力打造更快、更智能、更高效的代理式 AI
随着 AI 从聊天机器人向自主智能体演进,开放模型正在满足市场对全面掌控 AI 运行位置、部署方式和演化方式的需求。 今日,NVIDIA 宣布推出 Nemotron 3.5 Lightning,进一步扩展其 Nemotron 3 模型系列,这是同类产品中效率领先的模型,适用于长时间运行的代理式 AI 工作负载。此次发布紧随 Nemotron 3 Nano 之后,体现了 NVIDIA 对持续改进开放模型以提高准确性和速度的承诺。 Nemotron 3.5 Lightning 是一个 300 亿参数
随着 AI 从聊天机器人向自主智能体演进,开放模型正在满足市场对全面掌控 AI 运行位置、部署方式和演化方式的需求。
今日,NVIDIA 宣布推出 Nemotron 3.5 Lightning,进一步扩展其 Nemotron 3 模型系列,这是同类产品中效率领先的模型,适用于长时间运行的代理式 AI 工作负载。此次发布紧随 Nemotron 3 Nano 之后,体现了 NVIDIA 对持续改进开放模型以提高准确性和速度的承诺。
Nemotron 3.5 Lightning 是一个 300 亿参数的混合专家模型,专为大型多智能体系统中的特定任务而构建,有助于创建更智能、更高效的智能体应用。
此外,NVIDIA 还发布了 NeMo Switchyard,这是一款旨在为热门智能体工具提供智能路由的开源库。企业可以根据自己的特定需求用其来构建路由器。部署后,NeMo Switchyard 能够在开发者自行组合的开放模型、专有模型以及 NVIDIA 模型之间智能地将每个请求定向到强大且高度适合该任务的模型,而无需开发者重写其应用程序。
Nemotron 3.5 Lightning 和 NeMo Switchyard 共同赋予了用户对 AI 部署方式、运行位置以及运行效率的更出色的掌控力 —— 无论是在 PC、工作站、数据中心还是云端。

始终在线的智能体需要由多个模型组成的系统
现代智能体系统 (始终在线的智能体) 正越来越多地作为由多个模型组成的系统或模型集合运行,其中不同的模型专门负责不同的任务。
NVIDIA Nemotron 开放模型专为此架构设计。像 Nemotron 3 Ultra 或 GPT-5.6 这样的前沿推理模型可以规划和协调工作流,而像 Nemotron 3.5 Lightning 这样的小型专用模型可以执行代码审查、工具使用、安全警报监测和回答计费问题等目标任务。
借助 Nemotron 3.5 Lightning 赋能高并发专用任务
NVIDIA Nemotron 3.5 Lightning 是专为高并发任务而构建的完全可定制的开放模型,可为始终在线的智能体提供支持。该模型的开发得益于 Nemotron Coalition 的贡献,其成员提供了评估方法、推理软件和数据集,助力推进模型发展。
与同类模型相比,该模型的输出速度至高可提升至原来的 4 倍,可将智能体任务的完成速度提升 30%。得益于 Nemotron 3.5 Lightning 开放且可定制的特点,企业可以轻松地利用 NVIDIA NeMo 结合自身的领域数据、工具和工作流对其进行后训练,以提高专用任务的准确性。

各行各业的 AI 领导者正在为其工作负载定制 Nemotron 3.5 Lightning,帮助提高特定领域智能体任务的准确性。例如,CrowdStrike 将其用于网络安全、Harvey with Trajectory 将其用于法律服务、CodeRabbit 结合 Baseten 将其用于代码审查。此外,Lila Sciences 正在利用它帮助提高物理和生命科学领域智能体任务的推理能力;Fastino Labs 对该模型进行了定制,在软件开发、金融和医疗工作负载方面取得了领先的准确性。

Nemotron 3.5 Lightning 还让企业能够管理隐私和部署。它可以在本地 AI 系统上运行 —— 包括 NVIDIA RTX PC、NVIDIA DGX Spark 以及 NVIDIA Jetson,帮助用户充分利用现有的基础设施投资,或在边缘 AI 设备、NVIDIA RTX PRO 工作站、数据中心和云环境上进行扩展,以满足企业级用例需求。此外,针对需要快速响应的大量专用任务,Nemotron 3.5 Lightning 可在本地设备或企业内部运行。
此外,与每次发布 Nemotron 一样,NVIDIA 会在许可允许的范围内尽可能多地发布训练数据和技术,为其他模型的可追溯性、审计和训练提供了便利。与 Lightning 一同发布的还有 Nemotron-RL-Agentic-Terminal-Pivot,这是一个智能体强化学习数据集,用于对编码智能体功能进行后训练。
借助模型路由实现更高效的 AI 应用
有些模型更适合编码、有些更适合推理、有些更适合轻量级任务,还有些经过优化,可在本地运行,以提高隐私性和效率。如果客户仅依赖一个默认模型,可能会导致成本超支或降低质量;如果他们手动管理路由,则会变成集成工作,从而拖慢部署速度。
NVIDIA NeMo Switchyard 是一个面向 AI 智能体的开源模型路由库。该技术根据特定需求,自动将提示词路由到智能体工作流每个步骤中能力较强、效率较高的模型。智能体应用开发者可以使用不同的路由算法来调整或修改路由器,以满足他们在质量、延迟和成本方面的优先级要求。在由多个模型组成的系统中,企业可以创建具有更优的 Token 经济学的强大 AI 智能体。
内部基准测试表明,NeMo Switchyard 在保持前沿级准确性的同时,将任务完成成本降低到仅为使用 Opus 4.8 的约三分之一。

NVIDIA 正在与 AI 生态系统中的合作伙伴共同将智能模型路由引入开发者已在使用的工具和平台。
- Boomi:在五项路由功能上对 Switchyard 进行了评估,实现了 100% 的域路由准确性,将 59% 的流量发送到速度提升 5 倍的微调模型,并将后续轮次延迟降低了 21%。
- Cadence:在形式验证用例中使用 ChipStack AI Super Agent,将效率提升 9.9%。
- Classmethod:正在内部使用 NeMo Switchyard 运行 opencode 和 Fireworks 工作负载,初步测试显示,在保持质量的同时成本降低了 27%。
- Cognition:将 NVIDIA NeMo Switchyard 分阶段路由器集成到 Devin Desktop 中,供 NVIDIA 内部使用,在FrontierCode Main 实现了接近前沿的性能,同时与将所有请求路由到单个底层前沿模型相比,平均成本降低了 28%。
- Kong:通过 Kong AI Gateway 原生提供基于 NeMo Switchyard 的路由。
- LangChain:通过 NeMo Switchyard,在 145 个多轮 Deep Agent 任务中,仅将 7% 的调用路由到前沿模型,在 6% 的准确率妥协实现了 74% 的成本降低。
- LiteLLM:正在将 NeMo Switchyard 作为插件添加到其代理层中,因此,开发者无需更改现有技术栈即可获得这些优势。
- Nous Research:将 NeMo Switchyard 集成到 Hermes 中,为开发者提供易于配置的路由系统,以提高智能体效率。
- Ramp:在 Ramp SWE-Bench 使用 NeMo Switchyard 匹配前沿模型的性能,同时将成本降低 58%,运行时间缩短 33%。
- 西门子:正在进行基准测试,以提高 Fuse EDA AI Agent 效率。
Nemotron 3.5 Lightning 现已在 Hugging Face、魔搭社区、OpenRouter 作为 NVIDIA NIM 提供。用户也可通过 NVIDIA 云合作伙伴、后训练平台、推理平台和云服务提供商等广泛的生态系统获取。NeMo Switchyard 现已在 GitHub 上提供,并即将登陆各合作伙伴平台。