文档
论坛
BBS
博客
活动赛事
项目池
数据集
评测中心
关于社区
登录
活动
赛事
青龙 · 公版机
通用具身智能开发平台
小尺寸教具型机器人
动作生成基础大模型
具身智能仿真平台
白虎数据集
LET 数据集
开发者论坛 - OpenLoong
»
论坛
›
人形机器人大世界
›
强化学习
›
EgoSuite-Open100K 开源:人形机器人全身控制技术路线收 ...
返回列表
发布新帖
EgoSuite-Open100K 开源:人形机器人全身控制技术路线收敛的催化剂
6
0
用户c54cd433f391
Lv.1
发表于
昨天 21:43
|
查看全部
阅读模式
> 更新时间:2026-09-01
> 主题:人形机器人全身控制、VLA/WAM、Motion Planning、Whole-Body Control,以及 EgoSuite-Open100K 对统一技术路线的促进作用。
本文面向机器人研发工程师、技术管理者、产品负责人和行业分析人员。重点不是判断某一家公司的短期输赢,而是从第一性原理梳理:**哪些能力应该通用,哪些能力必须本体化,未来研发资源应该重点投入在哪一层。**
---
## 一、先给结论:人形机器人正在从“一个模型包打天下”走向四层分工
当前最清晰、也最符合第一性原理的技术路线正在收敛为:
```text
World / Task Brain
任务理解、场景理解、世界预测
↓
Motion Planning / Motion Generation
生成未来全身运动意图
↓
Whole-Body Control
把运动意图变成本体可执行的稳定全身动作
↓
Motor Control
执行器闭环
```
### 各层运行在不同时间尺度
| 层级 | 更合理的时间尺度 | 典型职责 | 已公开例子 |
|---|---|---|---|
| World / Task Reasoning | 约 1–5 Hz,或按事件触发 | 场景理解、语言、任务分解、世界预测 | GR00T N1.7 整体 VLA 约 2.5 Hz;Figure S2 属于慢速语义层 |
| Motion Planning / Action Generation | 约 2–30 Hz 更新规划,通常一次生成一段未来 motion/action chunk | 生成 root、BodyPose、手腕/手部、子目标和未来运动 | GR00T 一次输出一段 SONIC latent chunk;MotionBricks 属于这一层 |
| WBC / Whole-Body Motor Policy | 从约 50 Hz 到 kHz 级,取决于系统架构 | 平衡、运动跟踪、接触、全身协调 | SONIC 当前主要为 50 Hz;Figure S0 为 1 kHz |
| Motor / Drive Servo | 通常为 kHz 级内部闭环 | 电流、力矩、位置/速度伺服 | 多数由执行器驱动器实现,厂商往往不公开完整细节 |
真正重要的不是某个固定频率,而是:
> **慢速大脑解决“做什么”,运动规划层解决“身体应该怎样动”,高速 WBC 和执行器解决“这台机器人怎样稳定做到”。**
---
## 二、NVIDIA 当前最成熟的开放式路线:GR00T N1.7 + SONIC v1.1
截至 2026 年 9 月,NVIDIA 已经公开打通一条完整的人形 VLA 到全身控制路线:
```text
视觉 + 语言
↓
GR00T N1.7
↓
SONIC 64D motion latent
↓
SONIC v1.1
↓
全身关节命令
↓
Humanoid
```
官方 G1 工作流中:
- 官方 G1 示例中,上层 VLA 约以 2.5 Hz 更新一段 motion token chunk;
- 每次输出 64D × 40 的 SONIC motion token chunk;
- SONIC 以 50 Hz 解码并执行全身关节命令;
- VLA 不需要自己重新学习走路、平衡和全身协调。
这条路线最大的意义,是把“大脑”和“小脑”真正工程化分开。
---
### 2.1 大脑:GR00T N1.7 负责“做什么”
GR00T N1.7 处理:
- 视觉;
- 语言任务;
- 当前机器人状态;
- 任务相关动作决策。
它不需要直接解决每一步腿怎么迈、腰怎么补偿、双脚如何保持平衡。
这类能力交给 SONIC。
因此 VLA 的学习目标从:
> “看到画面后直接输出全部人形关节动作”
逐步转向:
> “根据任务和世界状态产生高层运动意图或运动 latent”。
---
### 2.2 小脑:SONIC v1.1 负责“这副身体怎样做到”
SONIC 是一个 Whole-Body Motor Foundation Model。
官方 universal-token 架构支持多种运动参考输入:
- 机器人关节轨迹;
- VR 头部 + 双腕目标;
- SMPL 人体姿态;
- 可选 SOMA skeleton。
不同输入经过不同 encoder,进入共享 SONIC latent,再由统一 decoder 输出全身关节动作。
SONIC v1.1 增加了两个非常关键的能力:
- heading-normalized target;
- wrist-pose augmentation。
这两项都明显面向 VLA、遥操作和全身操作。
---
### 2.3 长期更有价值的接口:Canonical Body Motion
长期看,大脑与运动小脑之间最值得标准化的不是某一版 SONIC 的 64D latent,而是具有明确物理意义的 Canonical Body Motion,例如:
```text
BodyPose / SMPL
+ Canonical Root
+ Left/Right Hand or Palm Pose
+ Hand Intent
+ Contact / Support Intent
```
当前 SONIC v1.1 的 SMPL mode 并不是只输入人体 joint points,还需要:
- SMPL joints;
- heading-normalized root orientation;
- wrist joint references。
因此更准确的长期架构是:
```text
Universal Brain
↓
Canonical BodyPose / SMPL
+ Canonical Root
+ Hand / Palm Pose
↓
Embodiment Compiler
↓
当前机器人需要的 root / wrist / joint-specific reference
↓
SONIC v1.1
```
Embodiment Compiler 负责:
- URDF / MJCF;
- joint axis;
- joint zero;
- joint limits;
- FK / IK;
- wrist adapter;
- reachable-space projection;
- collision constraints。
这样通用 Brain 不需要知道某台人形机器人的具体尺寸等物理参数。
---
### 2.4 SONIC 真正解决了什么
SONIC 的核心价值不是“把 SMPL 格式转换成关节角”。
它更重要地解决了:
- 人体运动到机器人运动的动力学落地;
- 平衡;
- locomotion;
- 双脚接触;
- whole-body coordination;
- 抗扰动;
- 动作平滑;
- 本体约束。
因此 SONIC 更准确的定位是:
> **Motor Foundation Model / learned WBC,而不是简单的格式转换器。**
---
## 三、MotionBricks:NVIDIA 正在补上的“中间运动层”
当前 NVIDIA 已成熟的工程链仍然是:
```text
GR00T N1.7
↓
SONIC 64D
↓
SONIC
```
MotionBricks 目前仍属于 preview,不能写成已经正式替代这条链。
但它代表的方向非常重要。
MotionBricks 是一个实时生成式运动模型,已经公开的模块包括:
- motion VQVAE;
- pose model;
- root model;
- latent motion synthesis。
它把 root motion 和 body motion 显式区分。
它正好填补:
```text
“大脑知道下一步该干什么”
↓
“具体应该生成怎样的一段完整全身运动”
```
之间的空白。
因此 NVIDIA 的长期路线很可能逐渐变成:
```text
World / VLA Brain
↓
MotionBricks-like Motion Planning
↓
Canonical Body Motion
↓
Embodiment Compiler
↓
SONIC
↓
Robot
```
这里:
- Brain 决定任务和目标;
- MotionBricks 生成连续全身运动;
- SONIC 保证这台具体机器人稳定执行。
---
## 四、盘点头部人形机器人全身控制路线
下面的排序基于:
- 技术开放程度及生态;
- 人形实机验证;
- 通用性;
- 数据和算力规模;
- 硬件与软件闭环;
- 跨本体潜力;
- 未来 3–5 年影响力;
做出的综合关注度排序,不代表市场份额预测,也不是对单一 benchmark 性能的排名。
---
### 第 1 名:NVIDIA —— GR00T + MotionBricks + SONIC
#### 路线
```text
GR00T / World Brain
↓
MotionBricks-like Motion Model
↓
SONIC
↓
Humanoid
```
#### 核心特点
- 大脑、小脑明确解耦;
- SONIC 已成为通用 Whole-Body Motor Foundation Model;
- SMPL、VR、robot motion 可进入统一 latent;
- MotionBricks 正在补 motion generation 层;
- Isaac Lab、Isaac Sim、Jetson Thor、GR00T、SONIC 形成完整生态;
- 开源程度在头部厂商中最高。
#### 最大优势
> **不是只做一台机器人,而是在做一套人形机器人的“AI 操作系统和标准接口”。**
这使 NVIDIA 最有机会影响行业的数据格式、Motion API、WBC、仿真、VLA 和部署工具链。
#### 当前风险
- SONIC 64D 仍然是 checkpoint-dependent internal latent;
- MotionBricks 尚未完全成为成熟的 VLA→SONIC 标准层;
- 真正跨大量 humanoid embodiment 的统一验证仍在发展。
#### 综合判断
**长期成为行业基础设施和开放标准路线的概率最高。**
---
### 第 2 名:Google DeepMind —— Gemini Robotics 2 的跨本体 Whole-Body Intelligence
2026 年 7 月发布的 Gemini Robotics 2 已经把 Google 的机器人路线从“桌面操作 VLA”推进到真正 whole-body humanoid control。
#### 路线
公开信息适合按功能模块理解:
```text
Gemini Robotics ER 2
场景理解、语言、长任务 reasoning
↓
Gemini Robotics 2
Vision-Language-Action
↓
Whole-body robot control
↓
Apollo / other embodiments
```
同时还有:
```text
Gemini Robotics On-Device 2
↓
新机器人少量数据快速适配
```
#### 核心特点
- 同一个模型 checkpoint 控制不同机器人 embodiment;
- 已展示 Apptronik Apollo 2 whole-body manipulation;
- 可以控制脚、躯干、双臂和复杂多指手;
- On-Device 版本强调用数小时数据适配全新本体;
- ER 2 专门负责分钟级 agentic reasoning;
- Google 同时与 Apptronik、Boston Dynamics 深度合作。
#### 最大优势
> **Google 正在直接把“最强通用多模态大脑”与“跨 embodiment robot action”合并。**
它非常接近:
```text
Universal Brain
+
Thin Embodiment Adaptation
```
这一长期理想路线。
#### 当前风险
- 完整低层 WBC 结构和接口没有公开;
- 不是开放模型;
- 外部开发者无法像 SONIC 一样自由替换本体控制层。
#### 综合判断
**如果“通用大脑 + 少量新本体适配”成为最终范式,Google 是最强竞争者之一。**
---
### 第 3 名:Figure —— Helix 02 的 S2 + S1 + S0 纵向一体化路线
Figure 采用的是非常清楚的多时间尺度分层。
#### 路线
```text
System 2
场景理解、语言、长时任务
↓
System 1
全传感器 → 全身 joint target
↓
System 0
高频 learned whole-body controller
↓
Actuator
```
公开参数:
- S1:200 Hz full-body joint targets;
- S0:1 kHz learned whole-body controller;
- S0 约 10M 参数;
- 超过 1000 小时 human motion;
- 超过 20 万并行仿真环境。
#### 核心特点
- head camera、palm camera、tactile、proprioception 全部进入统一系统;
- locomotion 与 manipulation 不再由状态机切换;
- 展示了多分钟连续自主 loco-manipulation;
- whole-body balance 与 dexterous hand 紧密联合。
#### 最大优势
> **目前公开展示中,Figure 的“完整真实人形机器人长任务闭环”非常强。**
它不是单独展示 walking,也不是单独展示 manipulation,而是:
```text
walking
+ reaching
+ balance
+ bimanual manipulation
+ tactile
+ task memory
```
一起完成。
#### 当前风险
- 闭源;
- 高度绑定 Figure 自身机器人;
- 不追求公开通用 BodyPose / Motion API;
- 不容易迁移成行业公共标准。
#### 综合判断
**如果端到端纵向整合胜出,Figure 是最强候选之一。**
---
### 第 4 名:Tesla —— Optimus 的“大规模数据 + 视觉规划 + 垂直整合”路线
> Tesla 当前公开的技术细节远少于 NVIDIA、Figure 和 Google,因此不应该凭公开视频猜测其内部模型结构。
官方明确公开的是:
```text
Advanced AI for vision and planning
↓
Balance
Navigation
Perception
Physical interaction
↓
Optimus
```
#### 核心特点
- 视觉和规划 AI 是整个 Tesla AI 技术栈的核心;
- 自研推理硬件;
- Optimus、汽车 AI、制造体系共享大规模工程基础;
- 机器人最终目标是 general-purpose autonomous humanoid;
- 硬件、AI、生产和真实工厂场景高度垂直整合。
#### 最大优势
Tesla 的核心竞争力不一定是某一篇论文,而是:
> **真实机器人数量 × 工厂任务 × 数据闭环 × 自研硬件 × 制造规模。**
如果 Optimus 大规模部署,真实数据飞轮可能迅速形成:
```text
机器人部署
→ 失败/成功数据
→ 模型更新
→ fleet deployment
→ 更多数据
```
#### 当前风险
- 完整 WAM / VLA / WBC / motion model 技术架构没有公开;
- 缺少可以独立复现的系统论文和代码;
- 当前很难判断其中间接口是否会向 Canonical Motion 收敛。
#### 综合判断
**产业化潜力极高,但从公开研究资料看,技术路线透明度最低。**
---
### 第 5 名:Boston Dynamics —— Atlas 的“强控制底座 + RL + Large Behavior Model”路线
Boston Dynamics 的优势是几十年积累的动态全身控制和真正工业级 humanoid 硬件。
2026 年生产版 Atlas 已开始进入客户部署。
#### 当前路线
Boston Dynamics 已公开两条互补能力:
```text
Human motion / Simulation
↓
RL Whole-Body Control
↓
Atlas
```
以及:
```text
Images + Proprioception + Language
↓
Large Behavior Model
↓
Full-body action @ 30 Hz
↓
MPC / learned control infrastructure
↓
Atlas
```
#### 核心特点
- 全身 dynamic control 能力极强;
- human reference + RL 已用于复杂运动;
- Large Behavior Model 已直接控制完整 Atlas;
- LBM 使用 diffusion transformer + flow matching;
- 结合 VR teleoperation、MPC、RL 和多任务训练;
- 2026 年与 Google DeepMind 开始 Gemini Robotics + Atlas 合作。
#### 最大优势
> **Boston Dynamics 是“身体 intelligence”最深厚的公司之一。**
它非常可能形成:
```text
Google / Foundation Brain
+
Boston Dynamics Motor Intelligence
```
这种强组合。
#### 当前风险
- 开放程度较低;
- 软件体系和数据接口不像 NVIDIA 那样面向整个行业;
- Google、NVIDIA、TRI 等合作很多,未来“Brain 层”最终属于谁仍可能变化。
#### 综合判断
**在工业 humanoid 和高性能 whole-body embodiment 上长期竞争力极强。**
---
### 第 6 名:Meta —— V-JEPA 世界模型路线,当前还不是完整 Humanoid WBC
Meta 之所以应该被列入,是因为它可能影响未来“Brain”层的基本设计。
但必须明确:
> **目前 V-JEPA 2 不是一套完整的人形机器人全身控制方案。**
#### 当前路线
```text
100 万小时级互联网视频
↓
V-JEPA 2
Universal latent world model
↓
少量 action-conditioned robot data
↓
Planning
```
#### 核心特点
- 不依赖人工标签的大规模视频自监督;
- 重点学习 understanding、prediction、planning;
- 世界模型与具体机器人 embodiment 解耦;
- 只使用较少 robot interaction data 就可以建立 action-conditioned predictor;
- 潜空间预测比完整视频生成更适合作为实时 world representation。
#### 最大优势
Meta 最有价值的不是今天直接控制 humanoid,而是:
> **可能提供未来所有机器人共享的 Universal World Encoder。**
如果以后接:
```text
V-JEPA-style World Brain
↓
Motion Generator
↓
SONIC / other Motor Foundation Model
```
它会非常接近本文讨论的最终收敛路线。
#### 当前风险
- 没有公开完整 humanoid whole-body motor stack;
- 当前机器人验证仍主要是机械臂 planning;
- 缺少与 SONIC / S0 类 Motor Foundation Model 的直接官方集成。
#### 综合判断
**作为“未来 Universal Brain”的潜力很高。**
---
## 五、产业路线虽然实现方式不同,但正在出现明显的收敛趋势
表面看:
- NVIDIA 强调模块化;
- Google 强调通用跨本体模型;
- Figure 强调纵向一体化;
- Tesla 强调部署规模与数据闭环;
- Boston Dynamics 强调 physical intelligence;
- Meta 强调 world model。
但底层趋势其实越来越一致。
---
### 趋势一:语义大脑和运动小脑开始分开
越来越少的成熟系统会要求一个慢速 VLM 同时负责:
- 语言;
- 世界理解;
- 走路;
- 平衡;
- 高频 motor control。
更自然的结构是:
```text
World / Task Brain
↓
Motion Policy / Motion Planner
↓
Whole-Body Motor Model
↓
Motor Servo
```
Figure 的 S2 / S1 / S0 与 NVIDIA 正在形成的 GR00T / MotionBricks / SONIC 分层,本质上都符合这个规律。
---
### 趋势二:Human / Ego data 成为通用知识来源
未来不可能主要依赖百万小时机器人遥操作数据来学习所有世界常识。
更可能是:
```text
人类第一人称视频
+ 人体运动
+ 互联网视频
↓
学世界、任务和通用运动
↓
较少 robot data
↓
做 embodiment grounding
```
这与 Meta V-JEPA、Google 跨本体、NVIDIA EgoScale/SONIC 的方向一致。
---
### 趋势三:中间“运动表示”会越来越重要
不同公司现在叫法不同:
- SONIC latent;
- semantic latent;
- full-body joint target;
- action chunk;
- BodyPose / SMPL;
- motion token。
但它们都在解决同一个问题:
> **大脑不应该重新学习每一台机器人最底层的身体控制。**
长期更有希望形成:
```text
World / Task
↓
Canonical Motion
↓
Embodiment-specific Motor Model
```
最终行业接口是不是 SMPL、BodyPose、Motion Token,还没有完全确定。
---
### 趋势四:WBC 正在变成 Motor Foundation Model
过去:
```text
walking controller
+
squat controller
+
teleop controller
+
task controller
```
未来:
```text
Large Human Motion Corpus
↓
Universal Whole-Body Motor Prior
↓
不同高层任务共同调用
```
SONIC、Figure S0、Boston Dynamics 的 whole-body RL 都明显朝这个方向发展。
---
### 趋势五:跨本体适配数据会越来越少
Google Gemini Robotics 2 已公开强调:
> 新 embodiment 可以通过数小时数据进行适配。
Meta V-JEPA 2 也展示:
> 大规模无动作视频预训练后,只需要相对少量 robot interaction data 就能建立 action-conditioned world model。
未来目标越来越明确:
```text
Universal Knowledge
↓
Thin Embodiment Adapter
↓
Specific Robot
```
---
### 补充观察:Isaac 0.5 代表“通用大脑”进一步融合的开放路线
Perceptron AI 的 Isaac 0.5 不是人形 WBC,但值得作为 Brain 层信号关注。它把视频理解、空间定位、任务进度、future-percept prediction 和 robot action 放进同一个 36B sparse backbone,并联合使用大规模通用视频、第一人称视频和多机器人数据训练。
对本文最有意义的不是其具体 action head,而是它进一步验证了:
```text
海量通用 / Ego Video
↓
World + Task Representation
↓
少量 Robot Grounding
↓
Specific Embodiment
```
因此 Isaac 0.5 更适合被看作帮助 Universal Brain 收敛,而不是 SONIC/WBC 的替代物。其官方 scaling experiment 也表明,大规模通用视频可以显著降低达到同等 action-prediction loss 所需的 teleoperation 数据量;这一结果仍应与真实闭环任务成功率区分开来。
---
## 六、收敛后的具体系统:World Brain → Motion Brain → Motor Brain
如果把前面的产业成果和公开研究路线抽象到第一性原理,人形机器人最终必须连续回答三个不同的问题:
```text
世界现在是什么状态、任务下一步是什么?
↓
为了完成这一步,人形主体应该怎样运动?
↓
这台具体机器人怎样稳定、可执行地做到?
```
因此,比“一个巨型 VLA 直接输出所有电机动作”更清晰的长期架构是:
```text
World Brain
世界理解、任务规划、世界预测
↓
Motion Brain
生成未来 Canonical Motion
↓
Embodiment Compiler
把通用运动编译成具体本体参考
↓
Motor Brain / WBC
SONIC 等模型完成平衡、全身协调和稳定执行
```
---
### 6.1 World Brain:先理解世界和任务,而不是急着输出关节动作
Universal Brain 的第一层首先要形成可用于行动的 World State。它至少应理解:
- 场景中有哪些关键物体;
- 物体和机器人在哪里;
- 什么正在运动;
- 谁与谁发生接触;
- 当前任务处于哪个阶段;
- 哪些对象可以被抓取、推动、打开或放置;
- 当前动作是否正在成功推进任务。
这一层可以吸收 V-JEPA 2 一类潜空间世界模型的思想:
```text
Video / Observation
↓
World Encoder
↓
World Latent
```
重点不是生成漂亮的未来视频,而是形成稳定、紧凑、可用于预测和规划的世界表示。
---
### 6.2 Event / Subtask Planner:把长任务拆成可执行阶段
长任务不适合一次生成完整的几分钟动作。更合理的是持续判断:
```text
当前在做什么?
下一阶段是什么?
当前最重要的 subgoal 是什么?
```
例如“把杯子放进柜子”可以自然拆成:
```text
approach
→ reach
→ grasp
→ lift
→ move
→ place
→ release
```
这一层正是 EgoSuite 的 event-level semantic annotation 特别有价值的地方:它把“连续视频”进一步组织成“有任务意义的阶段”。
因此未来 Brain 不只是一个视觉编码器,还应包含 Task / Event Planner 和必要的任务记忆。
---
### 6.3 新型 World Model:不仅预测未来世界,还要预测未来 Motion
传统 World Model 主要回答:
> “如果继续这样做,世界会变成什么样?”
但对人形机器人来说,仅预测未来世界还不够。系统还必须回答:
> “为了让世界变成目标状态,身体应该怎样动?”
因此更有价值的 World-Motion Predictor 是同时预测两类未来:
```text
Current World Latent + Task / Subgoal
↓
World-Motion Predictor
↙ ↘
Future World Latent Future Canonical Motion
```
例如抓杯子时,一边预测:
- 手会接近杯子;
- 接触会建立;
- 杯子会离开桌面;
同时预测:
- root 是否需要前移;
- 上身如何前倾;
- 右臂怎样伸展;
- palm 应该以什么姿态接近;
- 抓取后身体怎样恢复。
这一设计把“世界应该怎样变化”和“身体怎样造成这种变化”真正连接起来。
WAM 方向已经给出一个重要信号:未来 World Model 与 Motion Model 很可能联合训练,而不是完全割裂。
---
### 6.4 Motion Brain:把 subgoal 变成连续 Canonical Motion
World Brain 决定“下一步做什么”,MotionBricks-like Motion Model 负责生成“身体具体怎样连续运动”。
它的输出不宜首先绑定某台机器人关节,而应尽量采用跨本体、具有明确物理意义的 Canonical Motion,例如:
```text
Root trajectory
BodyPose / SMPL
Left / Right Hand or Palm Pose
Hand / Grasp Intent
Contact / Support Intent
```
这层可以理解为 Universal Motion Model 或 Motion Brain。
它的价值是把:
```text
语义任务
```
编译成:
```text
连续、自然、可规划的人形运动
```
而不负责最终的动力学稳定控制。
---
### 6.5 Embodiment Compiler:解决“同一个人体运动,换一副身体怎样实现”
Canonical Motion 仍然不是 FA、G1 或 H2 的最终控制量。这里的 **FA 指北京深谋科技自研的 31DoF 人形机器人**。
每台机器人都需要一个 Embodiment Compiler,利用本体资源完成:
- URDF / MJCF;
- 关节拓扑、轴和零位;
- 关节限位;
- FK / IK;
- wrist adapter;
- reachable-space projection;
- collision constraints。
对于 FA,通用 Brain 没有必要学习 FA 专属的信息,以后换成 G1、H2 或其他 humanoid,只需要更换本体编译层,训练或微调小脑,
而不必重新定义世界和任务大脑。
---
### 6.6 SONIC 64D:更适合做 Motor IR,而不是行业长期标准 API
当前 NVIDIA 工程链中,64D SONIC latent 非常高效,适合连接 VLA 和 SONIC。
但它依赖具体 SONIC encoder / checkpoint,因此长期更适合定位为:
> **SONIC 内部的 Motor IR。**
而 Canonical Motion 更适合定位为:
> **跨模型、跨本体、可解释的长期 Motion API。**
可以把两者类比为:
```text
Canonical Motion ≈ 高级语言
SONIC 64D ≈ 编译器中间表示 IR
Robot joint target≈ 机器码
```
未来 Brain 可以同时保留两条输出路径:
```text
Universal Brain
↙ ↘
Canonical Motion 64D Fast Head
↓ ↓
Embodiment Compiler │
↓ │
64D ─────────────────┘
↓
SONIC
```
Canonical Motion 路径负责通用性、可解释性和跨版本兼容;64D Fast Head 则适合熟悉任务下的低延迟执行。
---
### 6.7 在线执行必须闭环,而不是一次性生成完整长任务
真正运行时,更合理的是短时滚动规划:
```text
观察当前世界
↓
更新 World Latent
↓
判断 Task / Event Phase
↓
选择下一 Subgoal
↓
预测 Future World + Future Motion
↓
Embodiment Compiler
↓
SONIC / WBC 执行一小段
↓
获得新观察
↓
重新规划
```
这种 receding-horizon 结构可以及时处理:
- 物体位置变化;
- 抓取失败;
- 滑落;
- 接触偏差;
- 人或障碍物进入场景;
- 机器人自身执行误差。
因此,“World Model”真正有价值的地方不是离线想象,而是帮助闭环系统持续校正下一段运动。
---
### 6.8 数据也随之自然分成三层
#### Universal Pretraining
主要使用:
```text
Internet Video
EgoSuite
Human Motion
Language / Event
```
学习:
- World Representation;
- Task / Event Phase;
- Future World;
- Future Canonical Motion。
这一阶段不需要绑定 FA。
#### Multi-Robot Grounding
加入 G1、FA、DROID 及其他机器人数据,学习:
- Canonical Motion 与 robot-executable motion 的关系;
- 跨 embodiment 对齐;
- action-conditioned world dynamics。
#### Specific Robot Calibration
最后只用高价值真机数据校正:
- 相机域;
- wrist;
- 精确接触;
- 小物体操作;
- actuator delay;
- 不可达状态;
- failure / recovery。
也就是说,真机数据的职责逐渐从“教机器人整个世界和任务”转向“校正这副具体身体的真实物理”。
这正是下一节 EgoSuite-Open100K 变得重要的原因:它第一次在开放数据中同时提供了大规模第一人称视觉、事件语义、Hand Pose 和 Full Body Pose,使 World Brain 与 Motion Brain 可以在同一份人类真实经验上联合训练。
---
## 七、EgoSuite-Open100K:为什么它可能成为这条统一趋势的重要催化剂
EgoSuite-Open100K 的意义不只是“数据量大”。
真正关键的是:
> **它把第一人称视觉、Hand Pose、Full Body Pose 和事件级语义放到同一套大规模数据体系里。**
这正好对应未来人形机器人的三个核心训练对象:
```text
看见什么
→ 现在在做什么
→ 身体应该怎样动
```
---
### 7.1 基本规模
EgoSuite-Open100K 规划:
- 总规模:100,000 小时;
- 当前首批已开放约 10,000 小时;
- 15,000+ tasks;
- 15,000+ collection scenes;
- 7 类环境;
- 128 类 scene types;
- 18 类 task categories;
- 支持 LeRobot v3 和 MCAP。
---
### 7.2 两大系列和四种核心数据配置
EgoSuite 分为 EgoStandard 和 EgoPro 两大系列。
| 数据 | 规划规模 | 头部相机 | 腕部相机 | Hand Pose | Body Pose |
|---|---:|:---:|:---:|:---:|:---:|
| EgoStand | 80,000 h | ✓ | — | ✓ | — |
| EgoStand-Body | 10,000 h | ✓ | — | ✓ | ✓ |
| EgoProStandard | 8,000 h | ✓ | ✓ | ✓ | — |
| EgoProStandard-Body | 2,000 h | ✓ | ✓ | ✓ | ✓ |
因此完整规划规模正好是:
```text
80K + 10K + 8K + 2K = 100K hours
```
其中:
- **12,000 小时规划包含 Full Body Pose**;
- **10,000 小时规划包含 Wrist-view Camera**;
- 官方另外提供 **50 小时 EgoDemo**,覆盖四种配置,非常适合先研究数据结构和训练 pipeline。
这比把四种 SKU 分散描述更容易看出整个数据集真正的价值分布。
---
### 7.3 Hand Pose
公开 Data Contract 中,每只手提供:
```text
21 × 3 position
21 × 4 rotation
```
也就是说,不只是“手腕在哪里”。
还保留大量手部姿态与旋转信息。
这对人形机器人特别重要,因为:
- 手经常被头部相机遮挡;
- 接触时手在图像中尺寸很小;
- grasp、push、pull、rotate 对 palm orientation 非常敏感。
EgoPro 的 wrist camera 又进一步改善:
- 近距离抓取;
- contact;
- 自遮挡;
- 小物体操作。
---
### 7.4 Full Body Pose
公开 Data Contract 中提供:
```text
22 × 3 body positions
22 × 4 body rotations
```
这是 EgoSuite 与 SONIC / MotionBricks 路线最关键的连接点。
它可以进一步转换为:
```text
Canonical skeleton
或
SMPL / SOMA-compatible motion
```
然后产生:
- Canonical BodyPose;
- root trajectory;
- palm / wrist pose;
- motion token;
- SONIC pseudo latent。
这意味着过去只能用于“看视频”的大量人类数据,现在可以进一步变成:
> **大脑 → 全身运动规划的监督数据。**
---
### 7.5 Event-level semantic annotation
选定数据子集中还包含时间段级 event semantics。
它提供的信息不是:
> “某个像素移动了”。
而是:
> “这一段人在做什么”。
例如:
```text
approach table
→ reach handle
→ grasp
→ pull
→ release
```
这非常适合训练未来 Universal Brain 的:
- task phase;
- subtask planning;
- temporal segmentation;
- long-horizon memory;
- motion transition。
它正好补上纯 Motion Capture 最大的缺点:
> MoCap 知道“身体怎么动”,但不知道“为什么这样动”。
---
### 7.6 EgoSuite 当前没有解决什么
EgoSuite 非常重要,但不能把它理解成“机器人数据已经不需要了”。
目前公开标准 Data Contract 并没有提供:
- robot joint action;
- torque;
- motor current;
- contact force;
- tactile;
- actuator delay;
- robot failure dynamics。
当前官方公开 Data Contract 也没有把 depth map 列为标准原生模态。
因此 EgoSuite 解决的是:
```text
Human world experience
+
Human motion
+
Task semantics
```
而不是具体机器人的物理执行问题。
---
## 八、EgoSuite 对统一技术路线的四个直接催化作用
| 作用 | 过去的缺口 | EgoSuite 带来的变化 |
|---|---|---|
| 催化 Universal Brain | 大规模数据主要是 video + text,缺少身体监督 | video + event + hand pose + body pose,可同时学习世界、任务阶段和 future body motion |
| 催化 Motion Planning | MoCap 有运动,但缺真实任务和视觉上下文 | 可直接训练 `World State + Task → Future Body Motion` |
| 催化 Brain → SONIC 接口 | VLA/WAM 依赖昂贵 VR 或机器人示范 | BodyPose 可转 Canonical Motion,并进一步生成 SONIC pseudo label |
| 催化跨本体泛化 | 直接学习某台机器人的 joint target,换本体需大量重训 | 同一 Canonical Motion 可分别通过 G1、FA、H2 等 Embodiment Compiler 落地 |
核心变化可以概括为:
```text
过去:Robot Demo → Robot Action
未来:Human / Ego Experience
↓
Universal Motion
↓
Embodiment Compiler
↓
Specific Humanoid
```
EgoSuite 不替代机器人数据,而是把机器人数据的职责进一步压缩到本体、接触、硬件和失败恢复等“最后一公里”。
---
## 九、最终可能收敛的技术路线
前文可以压缩成一条主线:
```text
Internet / Ego / Robot Data
↓
Universal World Brain
世界理解 + Task Reasoning + World Prediction
↓
Universal Motion Planning
BodyPose / SMPL + Root + Palm/Hand + Contact
↓
Embodiment Compiler
URDF + Topology + IK/FK + Wrist + Reachability
↓
Motor Foundation Model / WBC
SONIC / S0-like Motor Policy
↓
Motor Servo / Actuator
```
这条路线的第一性原理很简单:
> **世界知识尽可能通用,运动意图尽可能跨本体,只有最后的身体约束和高速控制必须本体化。**
它比“Camera → Giant VLA → Every Motor Torque”更符合人形机器人的不同时间尺度、知识来源和安全要求。
---
## 十、最值得记住的四个判断
### 1. 技术路线正在收敛,但中间表示还没有完全标准化
行业正在越来越明确地收敛到:
```text
Brain
→ Motion
→ Motor Foundation Model
→ Actuator
```
真正还没有统一的是:
> Brain 与 Motor Foundation Model 中间到底采用什么标准 Motion API。
Canonical BodyPose / SMPL + Root + Palm/Wrist + Contact,是目前非常有长期价值的候选。
SONIC 64D、Google internal action latent、Figure internal latent 等更像各系统自己的高效 Motor IR。
---
### 2. NVIDIA 当前最接近开放标准路线
原因不是单个模型绝对最好,而是:
```text
GR00T
+ MotionBricks
+ SONIC
+ Isaac Lab
+ Isaac Sim
+ Jetson
```
正在组成可被外部机器人重复使用的完整生态。
---
### 3. Google / Figure / Tesla 更可能形成高度一体化的商业路线
它们有机会做到极强性能,但未必会开放:
```text
Canonical Motion API
```
给行业使用。
因此未来很可能同时存在:
```text
开放模块化生态
vs
闭源纵向一体化生态
```
两种成功模式。
---
### 4. EgoSuite 的最大意义,是让“通用运动层”第一次真正拥有足够大的开放训练数据
SONIC 已经解决:
> “给我一个运动目标,我让机器人稳定做出来。”
EgoSuite 带来的机会是:
> “让大脑第一次可以从十万小时级的人类真实经验中学习,应该生成什么运动目标。”
所以它真正催化的是:
```text
Universal Brain
↓
Universal Motion Planning
```
这一层。
如果这一层成熟,人形机器人可能真正进入:
```text
海量 Human / Ego Data
↓
Universal Brain + Universal Motion
↓
少量 Robot Grounding
↓
Motor Foundation Model
↓
Specific Humanoid
```
这才是 EgoSuite-Open100K 最值得关注的长期意义。
---
## 参考资料
### NVIDIA
- GR00T Whole-Body Control
https://github.com/NVlabs/GR00T-WholeBodyControl
- SONIC Training Guide
https://github.com/NVlabs/GR00T- ... r_guide/training.md
- SONIC v1.1 configuration
https://github.com/NVlabs/GR00T- ... rvation_config.yaml
- MotionBricks
https://github.com/NVlabs/GR00T- ... e/main/motionbricks
### Google DeepMind
- Gemini Robotics 2: Whole-Body Intelligence
https://deepmind.google/blog/gem ... lligence-to-robots/
- Gemini Robotics 2 Model Page
https://deepmind.google/models/gemini-robotics/vla/
### Figure
- Helix 02: Full-Body Autonomy
https://www.figure.ai/news/helix-02
### Tesla
- Tesla AI & Robotics
https://www.tesla.com/AI
### Boston Dynamics
- Atlas Large Behavior Models
https://bostondynamics.com/blog/ ... s-find-new-footing/
- Atlas product and AI roadmap
https://bostondynamics.com/products/atlas/
- Boston Dynamics × Google DeepMind
https://bostondynamics.com/blog/ ... new-ai-partnership/
### Meta
- V-JEPA 2
https://ai.meta.com/research/vjepa/
- V-JEPA 2 world model and physical reasoning
https://ai.meta.com/blog/v-jepa-2-world-model-benchmarks/
### Perceptron AI / Isaac 0.5
- Model
https://huggingface.co/PerceptronAI/Isaac-0.5
- Code
https://github.com/perceptron-ai-inc/isaac
### EgoSuite-Open100K
- Official Hugging Face announcement
https://huggingface.co/blog/LightwheelAI/egosuite-open100k
- EgoStandard
https://huggingface.co/datasets/LightwheelAI/EgoStandard
- EgoPro
https://huggingface.co/datasets/LightwheelAI/EgoPro
- EgoDemo
https://huggingface.co/datasets/LightwheelAI/EgoDemo
回复
举报
返回列表
发布新帖
回复
高级模式
B
Color
Image
Link
Quote
Code
Smilies
您需要登录后才可以回帖
登录
|
立即注册
本版积分规则
发表回复
回帖后跳转到最后一页
用户c54cd433f391
Lv.1 新手上路
主题
1
回帖
0
精华
0
Ta的主页
发消息
Copyright © 2026 OPENLOONG. All Rights Reserved. Powered by
Discuz!
关注B站
关注视频号
关注微信公众号
Copyright © 2026
开发者论坛 - OpenLoong
版权所有
All Rights Reserved.
关灯
在本版发帖
扫一扫添加微信客服
返回顶部
快速回复
返回顶部
返回列表