← 返回顶部

直接感知—控制模型

·SYMBIOSIS RESEARCH

感知扩展让机器人更懂世界,但理解任务并不自动等于能够可靠行动。我们希望把智能模型的边界,从生成一个需要被追踪的运动学目标,推进到生成一个由当前身体状态决定、能够直接执行的物理动作。

文章目录

01 / PRELIMINARY

重新审视分层感知—控制范式

多数全身系统仍采用模块化架构:System 1 理解任务并生成高层运动目标,System 0 根据当前身体状态追踪目标。12这种设计便于复用已有控制器,却在完整的 Perception-to-Control 执行链上引入了三个问题。第一,Motion Interface 不充分:System 1 将完整上下文压缩为 Zt 时,可能丢失与控制相关的任务信息。第二,分别训练、串联推理:System 1 与 System 0 由不同目标独立优化,却必须在部署时组成同一条执行链。第三,低层动作边界:真正可执行的动作仍被 frozen System 0 已学习的 control distribution 限制。

图 01. 双层架构通过 Latent Policy 与 motion interface,将完整任务上下文传递给 Whole-Body Tracker;表征压缩、训练割裂与低层动作先验分别形成 Motion Interface 不充分、分别训练、串联推理和低层动作边界。

问题一:Motion Interface 不充分

Motion goal 说明“身体要做什么”,tracker 则结合 Zt 与当前 robot state,生成状态相关的 Joint Target。问题并不是 tracker 看不到身体状态,而是单纯 scaling goal generator 只会增强任务理解与目标表达,无法同步扩展 tracker 在不同接触、平衡和动力学条件下的物理动作映射。新增的感知与推理能力因此仍停在 motion interface 之前。

图 02 将同一批样本从 Latent Space 追踪到 Joint Target Space。在 Compare 模式中,latent-near 样本对通过 sample ID 对齐,distance panel 则量化状态条件映射后的动作分离程度。Whole-body loco-manipulation 中更大的分离并非 tracker 的错误,而是说明决定接触、平衡与上下肢协同的关键物理选择发生在接口之后;若只扩展上层 goal generator,这部分映射及其动作能力边界仍然不会随之扩展。34

图 02. Pair Explorer 追踪同一真实样本从 Latent Space 到 Joint Target Space 的变化,呈现相近 motion intent 如何对应不同的 physical action。

问题二:分别训练,串联推理

分层架构在推理时表现为一条连续链路,但这种连续性并不存在于训练目标中:System 1 的 Latent Policy 学习生成 motion interface,System 0 则独立学习 tracking、stability 或 control reward。二者只在部署时通过 Zt 接起来,System 0 的真实执行误差与视觉后果无法穿过 frozen interface 共同优化 System 1。5

图 03. Latent Policy 与 Whole-Body Tracker 在训练阶段分别接受 latent-level 与 control-level supervision;推理时二者才通过 motion interface Zt 串联,因此整条执行链路不存在统一的 end-to-end action objective。

问题三:低层动作边界

最终动作不仅受 decoder 形式约束,也受 System 0 训练数据所覆盖的 motion distribution 约束。若低层先验主要学习 locomotion-centric behavior,高层新增的 loco-manipulation 任务仍必须投影回这一执行分布;超出其覆盖区域的 joint-level action 不会因为更强的 perception 或 reasoning 自动变得可达。

图 04 以 Locomotion 与 Manipulation 激活作为水平坐标,并以高度表示相对样本密度,从而呈现两类数据的 motion distribution landscape。Locomotion-centric distribution 主要集中在 locomotion-heavy 区域,而 loco-manipulation 会进一步延伸到两类激活混合的区域;曲面重叠部分对应共享的 motion prior,未重叠部分则揭示新任务需要、却尚未进入 System 0 学习支撑范围的动作。

图 04. Whole-body locomotion-centric data 只覆盖有限的 whole-body execution region;whole-body loco-manipulation 所需动作进一步进入 locomotion 与 manipulation 高度耦合的区域,揭示 frozen low-level prior 的分布边界。

02 / METHOD

直接感知—控制模型

Direct Perception Control Model 从动作接口、表征耦合与闭环训练三个层面重构执行链。模型彻底移除中间运动表征,不再生成需要独立 Whole-Body Tracker 追踪的运动参考,而是把视觉、语言、身体状态、动作历史与执行反馈直接映射为可执行的关节与手部目标。Symbiotic Attention 则让感知表征与控制表征在共享 action objective 下彼此 attention,使任务理解受到动作可执行性的约束,动作生成也能持续利用语义上下文。

图 05. Direct Perception Control Model 不经过中间 Motion Interface,将感知与实时身体上下文直接映射为关节和手部目标;位于模型中央的 Symbiotic Attention 在训练中耦合感知与控制表征,异步视觉更新与连续本体反馈则维持闭环执行。

针对 低层动作边界,DriftDistill 让 Student 在闭环 rollout 中暴露偏离状态,并利用 Frozen Teacher 的纠正目标学习恢复。Offline BC 提供初始化;Stage 2 将 online rollout 状态与 offline demonstrations 结合,通过反复纠正与蒸馏,逐步覆盖真实部署中访问的状态与恢复路径。由此,中间接口被移除,感知与控制得以联合学习,可执行分布也随闭环训练持续扩展。

图 06. DriftDistill 先通过 Offline BC 初始化 Student;Stage 2 将 online rollout 访问的偏离状态与 offline demonstrations 联合训练,并由 Frozen Teacher 提供恢复目标,使 Student 学会处理部署中的状态偏移与恢复路径。

03 / DATA

增强移动操作数据

直接学习 physical action,监督必须落在机器人实际执行的 Joint Target Space。现有人类与机器人数据具有不同的 embodiment、动作表示和控制接口,无法直接合并。67我们因此把每类数据都转换为 G1 可执行、时间对齐的 joint trajectories,再将这种共同监督扩展到 15,010 小时。

统一异构运动信息

转换从每类数据最可靠的运动信号出发:遥操作人形机器人数据统一坐标系、关节定义与控制频率;头显数据根据可恢复的全身运动完成重建与重定向;第一视角视频则从手、腕与末端执行器轨迹恢复人形机器人全身运动。三条路径最终产出一致的关节目标监督。

图 07. 异构数据转换管线依据不同数据源中可靠保留的运动信息,将异构数据转换为统一、G1 可执行且时间对齐的 joint trajectories。

规模化统一数据集

统一后的数据集共 15,010 小时:6,781 小时 Human Ego、4,024 小时 Armed Robot、3,660 小时 Wheeled Humanoid,以及 545 小时 Bipedal Humanoid 数据。这些来源覆盖移动与交互能力不同的人类和机器人 embodiment8910;转换后,它们共同进入同一个 execution space,使训练不再依赖单一平台。

图 08. 15,010 小时具身训练数据覆盖 Human Ego 与多种机器人形态,为 whole-body loco-manipulation 提供规模化训练基础。

04 / PERFORMANCE

性能表现

移动抓取与放置

机器人走到桩前,弯腰下蹲后单手拿起,转身移动两步再放下;动作连续耦合抓取、负重平衡、转向与移动。

受限全身移动操作

在受限姿态与狭小空间中,躯干和双臂协同重构,同时维持稳定支撑与精确物体接触。

手—眼—脚协同

右脚控制油门,并在驶出弯道前快速向右转向,将视觉时机、精准油门控制与驾驶语义结合起来。

05 / OUR VISION

让智能成为可执行的身体动作

感知扩展解决了机器人“看懂世界”和“理解任务”的问题,但真正的 Whole-Body Intelligence 还需要同时理解任务目标、身体状态、动力学约束和动作后果。Direct Perception Control 的目标,正是缩短这段 Embodiment Gap。我们不是在训练一个更强的 Motion Planner,而是在训练一个从理解世界一直学习到如何使用自己身体完成任务的系统。

The next frontier of robot intelligence is not only better perception or better planning. It is learning how intelligence becomes physically executable action.

引用

@article{
  symbiosis2026directperceptioncontrol,
  author = {Symbiosis Robotics Team},
  title = {Direct Perception Control Model},
  journal = {Symbiosis Robotics Blog},
  month = {August},
  year = {2026},
  url = {https://symbiosis-robotics.com/research/dpc},
}