直接感知—控制模型
感知扩展让机器人更懂世界,但理解任务并不自动等于能够可靠行动。我们希望把智能模型的边界,从生成一个需要被追踪的运动学目标,推进到生成一个由当前身体状态决定、能够直接执行的物理动作。
文章目录
01 / PRELIMINARY
重新审视分层感知—控制范式
多数全身系统仍采用模块化架构:System 1 理解任务并生成高层运动目标,System 0 根据当前身体状态追踪目标。12这种设计便于复用已有控制器,却在完整的 Perception-to-Control 执行链上引入了三个问题。第一,Motion Interface 不充分:System 1 将完整上下文压缩为 Zt 时,可能丢失与控制相关的任务信息。第二,分别训练、串联推理:System 1 与 System 0 由不同目标独立优化,却必须在部署时组成同一条执行链。第三,低层动作边界:真正可执行的动作仍被 frozen System 0 已学习的 control distribution 限制。
问题一:Motion Interface 不充分
Motion goal 说明“身体要做什么”,tracker 则结合 Zt 与当前 robot state,生成状态相关的 Joint Target。问题并不是 tracker 看不到身体状态,而是单纯 scaling goal generator 只会增强任务理解与目标表达,无法同步扩展 tracker 在不同接触、平衡和动力学条件下的物理动作映射。新增的感知与推理能力因此仍停在 motion interface 之前。
图 02 将同一批样本从 Latent Space 追踪到 Joint Target Space。在 Compare 模式中,latent-near 样本对通过 sample ID 对齐,distance panel 则量化状态条件映射后的动作分离程度。Whole-body loco-manipulation 中更大的分离并非 tracker 的错误,而是说明决定接触、平衡与上下肢协同的关键物理选择发生在接口之后;若只扩展上层 goal generator,这部分映射及其动作能力边界仍然不会随之扩展。34
问题二:分别训练,串联推理
分层架构在推理时表现为一条连续链路,但这种连续性并不存在于训练目标中:System 1 的 Latent Policy 学习生成 motion interface,System 0 则独立学习 tracking、stability 或 control reward。二者只在部署时通过 Zt 接起来,System 0 的真实执行误差与视觉后果无法穿过 frozen interface 共同优化 System 1。5
问题三:低层动作边界
最终动作不仅受 decoder 形式约束,也受 System 0 训练数据所覆盖的 motion distribution 约束。若低层先验主要学习 locomotion-centric behavior,高层新增的 loco-manipulation 任务仍必须投影回这一执行分布;超出其覆盖区域的 joint-level action 不会因为更强的 perception 或 reasoning 自动变得可达。
图 04 以 Locomotion 与 Manipulation 激活作为水平坐标,并以高度表示相对样本密度,从而呈现两类数据的 motion distribution landscape。Locomotion-centric distribution 主要集中在 locomotion-heavy 区域,而 loco-manipulation 会进一步延伸到两类激活混合的区域;曲面重叠部分对应共享的 motion prior,未重叠部分则揭示新任务需要、却尚未进入 System 0 学习支撑范围的动作。
这三类限制分别回答三个不同问题:任务控制信息能否穿过中间表征,哪一种 action representation 能与 future visual dynamics 共同训练,以及最终策略能够表达哪些 PD targets。维度本身不是判断标准;真正关键的是表征语义、监督目标与 frozen decoder 的动作像集。
KINEMATIC REPRESENTATION & SUPERVISION
运动学表征与监督瓶颈
任务与视觉上下文 Xt、状态历史 Ht 必须先被压入 SONIC motion representation Zt。但 Zt 的监督语义是 desired motion / reference pose——它回答“身体应呈现什么运动”,并不直接回答“当前控制步应发出什么 joint target”。任务控制语义一旦在这层 kinematic abstraction 中消失,后续 decoder 无法恢复。
表征瓶颈若两个任务上下文在相同 H 下被压成相同 Z,却需要不同 A*,任何只读取 (Z, H) 的策略都无法区分。风险差正是被 kinematic representation 丢掉的 task-relevant control information。
监督瓶颈问题不是“64D 太小”。因为 Jh ∈ ℝ29×64,JhTJh 的 rank 至多为 29,不可能与满秩的 I64 全局等价:有些 token 误差几乎不改变动作,另一些方向却会被 decoder 放大。Direct-joint 直接在最终控制空间对齐监督。
DYNAMICS GROUNDING UNDER A FROZEN DECODER
冻结解码器下的动力学落地缺口
两条路径都读取 Xt 与 Ht;关键差异是 future visual branch 所 attend 的 hidden representation 受到什么监督。旧路径中的 EZ,t 只被明确要求解码 kinematics-level SONIC target;真正 state-conditioned 的 joint action 要等到 frozen decoder 之后才出现。Direct-joint 则让 future visual 直接 attend 一个由真实 joint-control target 监督的 EA,t。
联合训练缺口Frozen decoder 可以使用 proprioceptive feedback,但其 state-feedback law 位于 visual-action 模型之外,因此 ∂Lfuture / ∂θD = 0。Future prediction 无法根据视觉结果重塑“运动目标 + 当前状态 → joint control”的映射。
动力学落地Joint action 不是完整 dynamics,却是与 Ht 共同进入短时状态转移的控制变量。Action loss 使 At 可从 EA,t 解码,future loss 又从同一表示学习动作后果,因此它比只受 SONIC target 监督的表示更直接地锚定到物理变化。
FROZEN ACTION-MANIFOLD CONSTRAINT
冻结动作流形约束
固定状态历史 h 后,latent-based policy 无论上游模型多强,最终动作都必须属于 frozen decoder 对合法 SONIC latent 的动作像集 Mh。Direct-joint 移除的是这层 learned decoder constraint:它仍使用相同 29D PD-target 接口,但不再要求任务动作先落在 Mh 中。
严格的表达下界若任务所需动作 a* 位于 Mh 之外,旧路径存在正的不可约 action error;继续增强感知或规划也无法越过 frozen System 0 的表达边界。
自由度与代价64D → 29D 并不自动构成瓶颈,关键是合法 latent 的实际像集。Direct-joint 扩大了同一 PD-target 接口内的 hypothesis class,也同时失去 decoder 提供的平衡、平滑与全身协调先验,这些能力必须通过数据与闭环训练重新学习。
三点沿着旧路径依次发生:任务语义先被运动学表征过滤,state-conditioned action 再被隔离在联合训练之外,最终输出还受 decoder image 约束。Direct-joint 分别以 action-level supervision、dynamics-grounded co-training 和更自由的 joint-space output 放松这三层限制;它带来更大的可达能力,也承担重新学习稳定控制先验的责任。
02 / METHOD
直接感知—控制模型
Direct Perception Control Model 从动作接口、表征耦合与闭环训练三个层面重构执行链。模型彻底移除中间运动表征,不再生成需要独立 Whole-Body Tracker 追踪的运动参考,而是把视觉、语言、身体状态、动作历史与执行反馈直接映射为可执行的关节与手部目标。Symbiotic Attention 则让感知表征与控制表征在共享 action objective 下彼此 attention,使任务理解受到动作可执行性的约束,动作生成也能持续利用语义上下文。
针对 低层动作边界,DriftDistill 让 Student 在闭环 rollout 中暴露偏离状态,并利用 Frozen Teacher 的纠正目标学习恢复。Offline BC 提供初始化;Stage 2 将 online rollout 状态与 offline demonstrations 结合,通过反复纠正与蒸馏,逐步覆盖真实部署中访问的状态与恢复路径。由此,中间接口被移除,感知与控制得以联合学习,可执行分布也随闭环训练持续扩展。
03 / DATA
增强移动操作数据
直接学习 physical action,监督必须落在机器人实际执行的 Joint Target Space。现有人类与机器人数据具有不同的 embodiment、动作表示和控制接口,无法直接合并。67我们因此把每类数据都转换为 G1 可执行、时间对齐的 joint trajectories,再将这种共同监督扩展到 15,010 小时。
统一异构运动信息
转换从每类数据最可靠的运动信号出发:遥操作人形机器人数据统一坐标系、关节定义与控制频率;头显数据根据可恢复的全身运动完成重建与重定向;第一视角视频则从手、腕与末端执行器轨迹恢复人形机器人全身运动。三条路径最终产出一致的关节目标监督。
规模化统一数据集
统一后的数据集共 15,010 小时:6,781 小时 Human Ego、4,024 小时 Armed Robot、3,660 小时 Wheeled Humanoid,以及 545 小时 Bipedal Humanoid 数据。这些来源覆盖移动与交互能力不同的人类和机器人 embodiment8910;转换后,它们共同进入同一个 execution space,使训练不再依赖单一平台。
04 / PERFORMANCE
性能表现
机器人走到桩前,弯腰下蹲后单手拿起,转身移动两步再放下;动作连续耦合抓取、负重平衡、转向与移动。
在受限姿态与狭小空间中,躯干和双臂协同重构,同时维持稳定支撑与精确物体接触。
右脚控制油门,并在驶出弯道前快速向右转向,将视觉时机、精准油门控制与驾驶语义结合起来。
05 / OUR VISION
让智能成为可执行的身体动作
感知扩展解决了机器人“看懂世界”和“理解任务”的问题,但真正的 Whole-Body Intelligence 还需要同时理解任务目标、身体状态、动力学约束和动作后果。Direct Perception Control 的目标,正是缩短这段 Embodiment Gap。我们不是在训练一个更强的 Motion Planner,而是在训练一个从理解世界一直学习到如何使用自己身体完成任务的系统。
The next frontier of robot intelligence is not only better perception or better planning. It is learning how intelligence becomes physically executable action.
引用
@article{
symbiosis2026directperceptioncontrol,
author = {Symbiosis Robotics Team},
title = {Direct Perception Control Model},
journal = {Symbiosis Robotics Blog},
month = {August},
year = {2026},
url = {https://symbiosis-robotics.com/research/dpc},
}