新闻中心

  • 首页Our Projects机器人化身卡丁车手,技术突破再升级!

机器人化身卡丁车手,技术突破再升级!

2026-08-18 9213

今天,共生知行(Symbiosis Robotics)发布了一段令人惊艳的演示视频。画面中,一个机器人弯下身子,灵活地调整四肢进入狭窄的卡丁车驾驶座。当它驶上赛道,便根据前方的弯道变化迅速调整方向。右脚踩下油门,左脚则灵活控制刹车。随着镜头切换至终点,卡丁车完美地完成了甩尾,并在原地漂移了一圈。几段赛道的画面中,机器人不断根据弯道的特点做出反应,让人不禁感叹这个“机器人车手”的真实感。

然而,这段视频所揭示的并非仅仅是漂移的炫酷动作。它旨在探讨一个更基础的问题:机器人如今已经能够理解弯道,接下来要如何将这一判断转化为全身各关节的协调动作?为此,团队推出了一个名为直接感知控制(Direct Perception Control, DPC)的系统。该系统取消了先前采用的、需要独立进行全身追踪的中间运动表示,直接通过视觉信息、任务理解和身体反馈,将关节动作和手部目标结合在一起进行计算。

为了训练这套系统,团队整理了超过15,000小时的具身数据。那么,机器人驾驶卡丁车究竟难在哪里呢?首先是上车,卡丁车的座椅既低又狭,让机器人需降低躯干并重新安排髋、膝和四肢的位置,同时还要留出双手握住方向盘的空间。启动后,情况就变得更加复杂。机器人需要通过赛道图像识别弯道,并在此基础上协调手脚:双手调整方向,右脚控制油门,左脚控制刹车。车速和转向的变化使得身体的反馈不断调整,下一步的动作必须立刻做出变化。

从某种意义上说,难点不仅仅在于“会转方向盘”或“会踩油门”,更在于如何确保感知、决策和全身控制能够在持续运动中无缝对接。这一挑战暴露了人形机器人控制系统中的一个长期问题:理解任务的模型,与真正控制体态的模型之间的距离。此外,分层的运动接口究竟束缚了什么?

常见的人形机器人控制方案将“知道要做什么”与“身体如何实现”的任务区分成两个层面。许多系统像Figure Helix使用不同的方式处理低频语义推理和高频控制,而Gemini Robotics则采用具身推理模型与动作执行系统相结合。虽然这种分层设计已经相当成熟,但DPC希望进一步探索:是否可以将理解认知的模型和直接生成关节动作的运动专家在同一训练中进行联合优化,从而实现任务理解和全身控制的互相适应,共同提升。

传统的分层架构通常生成运动表示,随后由全身追踪系统计算出关节动作。DPC则探讨接口是否保留足够的信息,并关注训练的连接方式以及低层控制器的动作。运动目标(Motion goal)虽然能够描述大致的姿态,但在实际执行中,上层模型即便更了解任务,也无法自动掌握全身追踪器在不同接触和平衡条件下的动作。影响身体发力和支撑的关键选择仍发生在运动接口之后。相似的运动意图在映射身体状态后,可能对应明显不同的关节动作。

在实际操作中,连续执行时训练能否同步调整?在实际操作中,潜在策略(Latent Policy)和系统0将顺序运作。在训练阶段,前者学习生成运动表示,后者则独立学习追踪和平衡。直到部署时,这两套模型才通过接口连接。因此,低层动作产生的误差和图像变化无法同时用于调整上层策略。

当低层控制器被冻结时,机器人的行动能力是否还会扩展?最终,机器人能够执行的动作取决于系统0所接触到的训练数据。如果低层的训练主要是走路,高层新增的移动操作任务仍然需依靠这套已有的知识。进入狭小的卡丁车需要在有限空间内重新调整全身姿态,而驾驶过程中需要上下肢的协作,这些动作都超出了传统行走的范围。移动操作可能进入训练数据较少的区域,因此低层控制器所学习的动作范围同样影响最终表现。

这并不是 DPC 独自面对的问题。其他系统如ω-0、MotionWAM和Ψ₀将视觉信息与身体状态结合用于动作生成,但都仍存在分层控制。例如,前两者会先预测全身潜在的动作,然后再交给底层控制器执行,而Ψ₀则将上下肢解耦,分别生成下肢和上肢的指令。相比之下,DPC直接将关节目标作为训练的核心,在学习关节动作时始终结合任务信息和身体反馈。

DPC究竟如何将图像直接转化为关节动作?若限制来自中间接口,DPC的选择便不是继续拓展这一层表示,而是直接绕过它。根据官方的说明,DPC取消了独立全身追踪器所需的中间运动表示。DPC同时读取视觉信息和任务语言,同时接收身体状态;以往的动作记录和反馈已经融入了这一创新理念。

订阅我们的时事通讯

获取更多更新