BotOf TechAI / IoT / Full-Stack / 植物养护知识分享
返回首页GR00T 1.7 不只是一个 VLA:人形机器人策略开始拥有端到端工程栈

GR00T 1.7 不只是一个 VLA:人形机器人策略开始拥有端到端工程栈

机器人基础模型的发布通常最吸引眼球的是演示:双臂抓取、全身移动、听懂自然语言。但团队真正花时间的地方,是把数据、模型、仿真、评测和真机控制接起来。

NVIDIA Isaac GR00T 1.7 的信号在于,VLA 不再只以论文 checkpoint 的形态出现。官方把 Isaac Teleop、Isaac Lab-Arena、GR00T 模型、Isaac ROS 和 TensorRT 组织成从数据采集到部署的完整路径,并以 Apache 2.0 开放模型与代码。

它离“通用人形机器人”仍然很远,却更接近团队能持续开发和回归的策略平台。

先拆模型:VLM 负责理解,Diffusion Transformer 负责动作

GR00T 1.7 接收图像、语言和机器人状态,先由视觉语言骨干形成语义与空间表示,再由 flow-matching Diffusion Transformer 生成连续动作序列。

这两个部分承担不同问题:

  • VLM:目标是什么、对象在哪里、当前处于哪个子任务;
  • 动作头:末端执行器怎样移动、夹爪怎样变化、连续动作怎样平滑。

相较输出离散技能名,连续动作生成能表达更细的运动;相较直接让语言模型输出坐标,扩散动作头更适合建模多种可行动作和轨迹分布。但它仍然不是电机控制器,最终动作必须经过机器人控制栈、频率适配和安全约束。

1.7 使用 Cosmos-Reason2-2B(Qwen3-VL 架构)替换旧视觉骨干,支持更灵活的分辨率和原始宽高比。模型总规模约 3B,官方仓库给出的推理起点是 16GB+ VRAM,微调建议 40GB+。

跨本体的关键是动作坐标,不只是更多数据

不同机器人关节数量、臂长、夹爪和控制接口都不同。把原始关节角直接混在一起训练,很容易让模型记住硬件,而不是学习任务。

GR00T 1.7 强调 relative end-effector action:动作表达为相对当前末端位姿的变化,而不是绝对目标或特定关节命令。人类手部运动和机器人末端运动因此可以在更接近的空间中对齐。

这并没有消除本体差异。相对位姿仍需通过逆运动学、可达性、碰撞和控制器变成各机器人的关节动作;双指夹爪学到的操作也不能直接变成五指手的触觉策略。但统一动作接口降低了预训练知识迁移的摩擦。

数据规模很大,数据契约更重要

NVIDIA 技术文章提到约 3.2 万小时真实示范与人类第一视角数据,以及约 8000 小时仿真 rollout 和示范;官方仓库特别说明其中包含约 2 万小时 EgoScale 人类视频。

大规模人类视频提供物体交互和任务先验,真机轨迹提供机器人状态—动作配对,仿真覆盖扰动和长尾。但三类数据不能简单拼接,必须统一:

  • 相机、语言、状态、动作的时间同步;
  • 本体、传感器、标定和坐标系元数据;
  • 控制频率、动作 horizon 和执行 horizon;
  • 成功、失败、中止、接管与环境版本;
  • 数据授权、隐私和可追踪版本。

GR00T 使用 LeRobot 兼容格式,并支持多数据集路径和混合权重。真正影响微调结果的,往往不是总小时数,而是目标任务的有效轨迹、失败边界和数据分布是否匹配。

端到端平台的五个阶段

阶段工具位置必须产出的证据
环境建模Isaac Lab-Arena场景、机器人和传感器版本可复现
数据采集Isaac Teleop / 真机同步 episode、标注与质量报告
后训练GR00T 1.7checkpoint、配置、数据清单、训练曲线
策略评测Arena / benchmark / 真机成功、碰撞、时长、恢复和长尾
部署ONNX、TensorRT、Isaac ROS延迟、频率、硬件版本、回滚包

这条链的价值在版本连续性。一次成功演示可以来自手工环境和运气,策略平台要能回答:哪个数据集、哪个 checkpoint、哪个导出引擎、哪个控制参数在这台机器人上产生了这个结果。

Action Horizon 不等于可以开环执行

1.7 扩大了动作维度和预测 horizon。一次预测更长的动作块能降低模型调用频率,提升动作连贯性,却会增加开环风险:环境在执行过程中变化,后半段动作可能已不适用。

部署时要区分 prediction horizon 和 execution horizon。模型可以预测较长序列,但控制器只执行前几步,随后用新观测重规划。具体长度取决于:

  • 任务动态性和接触程度;
  • 感知与模型端到端延迟;
  • 控制器是否有快速局部反馈;
  • 动作误差随时间的累积速度;
  • 硬件能否在紧急状态立即覆盖模型命令。

自由空间搬运可以执行更长块,插接、抓取闭合和人机共域动作应缩短 horizon,并依赖力觉或局部视觉快速闭环。

评测不能停在开环动作误差

离线预测与专家动作接近,不代表闭环任务成功。一个轻微偏差进入真实环境后会改变下一帧观测,误差可能迅速累积。

建议至少建立四层评测:

  1. 数据层:时间同步、动作分布、异常值和标定一致性。
  2. 开环层:动作误差、语言跟随、子任务识别、不同本体迁移。
  3. 仿真闭环:随机位姿、光照、遮挡、摩擦、延迟和传感故障。
  4. 真机闭环:成功率、碰撞、接管率、周期时间、力矩峰值和恢复能力。

官方报告 DROID 与 SimplerEnv 多项提升,其中部分子集提升很大,但每个团队仍需用自己的机器人和任务重测。跨 benchmark 的百分比不能直接变成生产成功率。

模型上方和下方都需要安全层

上方是任务安全:允许哪些对象、区域和工具,谁能批准高风险动作。下方是运动安全:工作空间、速度、力矩、碰撞、关节限制和急停。

VLA 的合理位置是两层之间:根据感知和语言提出受约束动作,安全控制器过滤或覆盖。部署还应包含:

  • 模型置信度或 OOD 信号低时暂停并请求帮助;
  • 感知超时、动作服务断连时进入零能量或安全姿态;
  • 策略版本与机器人序列号绑定,禁止错配;
  • 新策略灰度到少量机器人和限定工位;
  • 失败 episode 自动进入可重放难例库。

GR00T 1.7 的真实意义:把集成成本变成可复用资产

基础模型不会替团队定义任务、标定相机、清洗数据、安装急停,也不会证明某个动作在你的工位安全。GR00T 1.7 更现实的贡献,是把长期分散的机器人学习工具接成一条可重复路径,让数据和评测接口逐渐稳定。

对产业团队来说,这比一次更炫的 demo 更重要。模型可能每几个月升级,真正应该沉淀的是本体适配、数据契约、场景库、验收器、部署包和失败回放。具备这些资产后,基础模型的进步才能安全地转化为机器人能力。

参考资料