NVIDIA SONIC 与优必选 Walker 系列:拓展全身运动能力,推进全尺寸人形机器人应用

NVIDIA 与优必选围绕 SONIC 的大规模运动追踪与统一策略学习能力开展协同,接入分布式训练链路,推进新本体适配与 Walker 系列真机验证,并将真实负载下的优化经验回馈开源社区,持续完善 SONIC 的适配与部署能力。 对全尺寸人形机器人而言,真正的挑战不只是完成某一个动作演示,而是让新的动作数据、机器人本体和控制入口能够持续进入同一研发闭环,同时保持稳定、协调的全身运动。 NVIDIA SONIC 以大规模运动追踪为基础任务,用统一策略学习广泛的人类动作。围绕这一路线,NVIDIA

Oct 8, 2026 - 10:00
 1
NVIDIA SONIC 与优必选 Walker 系列:拓展全身运动能力,推进全尺寸人形机器人应用

NVIDIA 与优必选围绕 SONIC 的大规模运动追踪与统一策略学习能力开展协同,接入分布式训练链路,推进新本体适配与 Walker 系列真机验证,并将真实负载下的优化经验回馈开源社区,持续完善 SONIC 的适配与部署能力。

对全尺寸人形机器人而言,真正的挑战不只是完成某一个动作演示,而是让新的动作数据、机器人本体和控制入口能够持续进入同一研发闭环,同时保持稳定、协调的全身运动。

NVIDIA SONIC 以大规模运动追踪为基础任务,用统一策略学习广泛的人类动作。围绕这一路线,NVIDIA 与优必选完成新本体训练链路接入,并针对大规模、长周期训练中暴露的系统瓶颈开展联合优化,进一步推进 Walker 系列真机验证,并通过真实回馈不断优化 SONIC 的适配和部署能力。

1.   NVIDIA SONIC:让全身控制能力随数据持续扩展

人形机器人要从少数动作演示走向真实应用,需要在稳定行走之外持续学习奔跑、下蹲、跪姿、爬行等全身动作,并接入动作捕捉、遥操作和运动规划等控制入口。

SONIC (Supersizing Motion Tracking for Natural Humanoid Whole-Body Control) 将这些需求统一为可规模化的运动追踪任务,让一套策略从多样化人体运动中学习平衡、落脚和全身协调,并结合机器人实时状态闭环生成关节指令。

统一运动追踪:一套策略学习多样化动作

SONIC 将行走、奔跑、下蹲、拳击和爬行统一为全身运动追踪任务。一套策略即可从人体动作数据中学习共性规律,无需为每种动作单独开发控制策略。

共享运动表示:连接多类控制输入

SONIC 将机器人轨迹、人体姿态和混合指令编码为统一的运动 Token,让游戏手柄、VR 和视频等入口接入同一控制策略。接入新本体时,仍需准备动作重定向数据并重新训练。

闭环控制:从参考动作到稳定执行

运动 Token 表达目标动作,控制策略结合机器人实时状态生成关节指令,并持续修正平衡和全身协调,而不是简单回放轨迹。

在三点式 VR 遥操作中,头显和手柄输入上肢意图,运动学规划器生成下肢运动,统一策略负责全身稳定执行。

跨本体复用:将重复开发变为标准化适配

跨本体并非直接复制已有 checkpoint。新机器人仍需准备本体模型、关节映射、执行器参数和重定向数据,并完成重新训练与真机校准。

SONIC 可复用数据处理、训练、评测、模型导出和部署框架,减少新本体接入的重复开发。公开仓库还提供 ONNX 导出、C++/TensorRT 部署和接入指南。

2. NVIDIA SONIC 在优必选 Walker 上的适配与应用

优必选的全尺寸具身智能人形机器人主要包括 Walker 系列、Cruzr 系列、优世界 U1 系列等,已形成工业 + 商用 + 家庭消费三大场景齐头并进的战略布局。

其中,Walker S2 面向工业制造场景,Walker C1 面向商用服务场景。不同场景对动作能力和控制方式的侧重点各不相同,但都需要底层运动系统支持自然、稳定的全身动作,并能够持续接入新的本体、动作数据和控制入口。

优必选将 SONIC 扩展到 Walker 新本体,并重新训练适配 Walker 本体的模型。在此过程中,完成了机器人模型与执行器接入、人体动作重定向、并行仿真训练、策略评测与导出,以及真机闭环校准。

训练中的工程问题发现和解决

优必选将 SONIC 扩展到 Walker 新本体后,Whole Body Control 模型需要经历长时间、大规模并行训练。训练过程中,观察到训练性能问题:随着训练迭代次数增加,训练主循环之外的时间持续增加。

现象一:训练主循环保持稳定,但额外时间持续增加

优必选工程师发现,随着训练迭代次数增加,有效训练时间占比不断下降,如图 1 所示。

图 1:整体训练时间与理想训练时间的关系

其中,wall time 表示训练总时间,total time = collect time + learning time,表示有效训练时间。在理想情况下,曲线应如图中虚线所示,为一条斜率为 1 的直线 (即时间利用率为 100%)。但实际曲线为图中的蓝线,随着训练时间增加,斜率逐渐降低;到 50 小时时,平均时间利用率不足 70%。

为定位长跑过程中训练变慢的位置,团队按每 250 次迭代将实际墙钟时间拆分为训练主循环计时和系统开销时间,结果如图 2 所示。

图 2:每 250 次迭代的训练主循环计时、系统开销时间及总时间。

图 2 显示,训练主循环计时始终约为每 250 次迭代 15 分钟,整体保持稳定;实际墙钟时间则从约 18 分钟增加到约 35 分钟,二者之间的系统开销由约 2 分钟扩大到约 17 分钟。到约 4 万次迭代时,系统开销已超过主循环计时,说明长跑后期增加的主要不是轨迹采集和策略学习本身,而是训练系统中的额外等待。

同时,优必选工程师还发现,每次迭代都执行垃圾回收 (GC) 操作,开销很大。团队尝试取消频繁 GC,但由于缓存清理不及时,引入了 OOM 问题。

现象二:显存峰值逐周期抬升,并最终触发 OOM

取消频繁 GC 后,训练中出现了周期性显存峰值,且峰值上沿随着训练时间逐步抬升。这一现象在单机 8 卡和两机 16 卡运行中均有出现,并最终影响训练稳定性和可并行环境数。如图 3 所示,黄色框表示训练时的常驻显存,红色框表示周期性峰值;峰值随训练持续增长,最终导致 OOM。

单机 8 卡训练的显存状态记录
两机 16 卡训练的显存状态记录

图 3:周期性显存峰值不断出现,且峰值用量在训练过程中持续抬升。

以上是优必选工程师在训练和优化中发现的问题。为解决训练性能及其后续问题,工程师进行了原因分析并制定了相应方案。

原因与解决方案

问题集中在训练系统的资源回收、显存引用和高频重复计算路径。对应原因与处理方式如下:

表 1:训练问题的原因与解决方案

现象原因解决方案
训练系统开销随训练增长每次迭代末尾都执行 Python GC 和 CUDA 缓存清理,增加同步等待并打断缓存复用。取消逐轮强制清理,将必要回收放到动作数据重采样和切片完成后的边界。
显存累积、碎片化与 OOM日志历史长期持有 GPU Tensor;循环内反复拼接产生大量不同尺寸的临时分配。日志写入前转为 CPU/Python 数值并仅由主进程保存;先汇总,最后一次拼接。
固定观测结构被重复计算字段形状和切片边界在每次策略前向中重新解析。在初始化阶段预计算并缓存观测字段、维度和切片位置,后续直接复用。
Checkpoint 准备时间随长跑增加保存前复制完整训练状态,其中包含持续增长、但无需写入 Checkpoint 的日志历史。先从状态副本中排除日志历史,再复制其余需要保存的状态。

优化结果

优化后,SONIC 的训练效率显著提升,系统开销大幅减少。如图 4 所示,修改后的有效训练时间曲线 (绿线) 十分贴近理想曲线,说明绝大部分墙钟时间均用于训练。与优化前相比,时间利用率提高约 31 个百分点。具体数据见表 2:同样经过 50 小时墙钟时间,累计有效训练时间由约 33.5 小时提高到约 49.0 小时。

图 4:优化前后累计训练计时与墙钟时间对比。优化后曲线更接近理想线

表 2:50 小时墙钟时间下的训练时间利用情况 (由原始记录计算)

运行状态墙钟时间累计主循环计时主循环外时间差时间利用率
优化前50 小时约 33.5 小时约 16.5 小时约 67%
优化后50 小时约 49.0 小时约 1.0 小时约 98%
变化 — 增加约 15.5 小时减少约 15.5 小时提高约 31 个百分点

与优化前系统开销随训练推进从约 5 分钟持续增加至约 28 分钟相比,优化后每 250 次迭代的系统额外开销仅在较低区间小幅波动,几乎不再随训练持续增长。如图 5 中的红色折线所示,优化后的额外开销很少,不再像图 2 中那样持续增长。这说明资源回收、日志引用和张量聚合等优化有效抑制了长跑中的额外时间增长,使更多墙钟时间用于轨迹采集和策略学习。

图 5:优化后每 250 次迭代的主循环计时、系统开销和墙钟时间。主循环保持稳定,系统开销处于较低区间。

减少 GC 频率后出现的显存 OOM 问题也得到了解决。由于降低了 GC 频率,常驻显存使用量会增加 1~2 GB,如图 6 所示;在当前训练中,这是可以接受的代价。

图 6:优化后常驻显存使用量增加约 1 — 2 GB

相关优化均已由优必选 / NVIDIA 工程师提交并合入 SONIC 仓库,用户可以直接使用。

3. 从训练系统走向 Walker 真机

完成 SONIC 模型训练后,优必选将该模型部署到全尺寸人形机器人 (Walker S2、Walker C1) 上,实现了出色的全身运动追踪和遥操作能力。

优必选使用动作捕捉设备采集动作数据,并录制了多种行为 (见下方视频)。这些行为覆盖稳定移动、全身协调和动态姿态,可从不同侧面检验统一运动策略在新本体上的适应能力。具体效果如下。

4. 面向更多机器人平台:持续完善 SONIC 的适配与部署能力

SONIC 通过开源的 GR00T-WholeBodyControl,为人形机器人开发者提供从运动数据处理、全身运动策略训练和评测,到模型导出与真机部署的一套 WBC 能力。面向新的机器人本体,开发者可以沿用统一的运动追踪目标和训练框架,在完成本体模型、关节映射、执行器配置和动作数据准备后,将这套能力扩展到新的硬件平台。

对生态用户而言,SONIC 提供了一条可复用的新本体适配路径:机器人运动、人体运动和混合运动指令可以通过共享运动表示接入控制策略;训练、评测、导出和部署工具可以在不同项目之间复用;来自真实训练负载的通用修复也会持续进入开源上游,减少后续开发者重复处理基础工程问题的投入。

随着更多机器人平台接入,新的本体结构、执行器特性和训练负载将继续检验并完善这套开源框架。NVIDIA 将持续补充新本体支持、训练效率、评测和部署工具,帮助开发者更高效地完成从机器人模型接入到真机验证的闭环。欢迎机器人开发者和产业伙伴通过 GR00T-WholeBodyControl 开源仓库开展新本体适配、验证实际工作负载,并将具有通用价值的改进回馈社区。

了解更多

Jat AI Stay informed with the latest in artificial intelligence. Jat AI News Portal is your go-to source for AI trends, breakthroughs, and industry analysis. Connect with the community of technologists and business professionals shaping the future.