苏黎世联邦理工学院的研究人员开发了 UniCross:一个 AI 策略,通过统一的共享框架掌握四种灵巧手技能——抓取、重新定位、手内旋转和手内平移。该统一系统保持了专家级性能,能够抵抗外部干扰,适应未见过的物体,并将多种技能端到端串联起来,完成长时程操作任务。这项工作展现了一种可能:机器人手不再依赖一套彼此割裂的狭窄技能库,而是由一个通用“大脑”统一控制。
目录
研究人员构建了什么
UniCross 团队试图回答一个看似简单的问题:抓取、重新定位、手内旋转和手内平移,究竟是四个不同的问题,还是同一个问题的四种表现?他们给出的答案是后者。系统将每种技能重新定义为一种手—物关系:什么保持固定、什么发生移动,以及运动在哪个参考系中定义;由此证明,这四种技能都可以归结为同一个统一表述。
由于所有技能共享相同的观测空间、动作空间和奖励结构,研究人员可以使用原始 DAgger 模仿学习,将十个按技能划分的专家策略蒸馏为一个统一的跨技能策略。最终得到的单一策略能够处理全部十种有效的(物体、技能)组合,并由同一个网络服务于所有技能。
这一框架并不依赖某一种机械手设计。它可以跨手部形态迁移,也就是说,不同机器人手无需重新设计整体架构,就能使用同一种表述。由于策略保留了跨技能兼容性,它可以按顺序连续执行抓取、重新定位、旋转和平移,过程中无需切换造成的不连续。作者认为,这为插头插入、拧紧螺丝和使用刀具等长时程任务奠定了基础。这项工作同样面向动画、AR/VR 和机器人技术领域。
关键结果
最核心的结果是:跨技能蒸馏并未牺牲单项技能的表现。统一策略在四种技能和全部训练物体上都展现出出色的单项性能,与蒸馏来源的十个技能专家不相上下;与此同时,它还获得了专家策略原本不具备的能力,例如无需重新初始化即可在不同技能之间切换。
抗干扰能力:面对可能使专家策略失稳的外部扰动时,统一策略仍能保持物体稳定。泛化能力:面对未见过的物体几何形状,策略能够产生适应性行为,而不是机械复现记忆中的轨迹。这表明它学到的是操作中的关系结构,而非一组死记硬背的动作。
跨形态迁移意味着同一套训练框架可以适用于不同的机械手设计,这对需要更换末端执行器的平台尤其重要。最显著的结果则是跨技能连续性。策略能够将抓取 → 重新定位 → 旋转 → 平移串联成完整的长时程动作序列,无需承担模式切换的额外开销。作者将此视为一个重要证据:灵巧操作技能并非彼此孤立的能力,而是共享解空间的不同实例——一个策略,多种技能。

工作原理
UniCross 首先重新定义了“操作技能”究竟是什么。每种技能都由一种手—物关系刻画:哪个元素被固定、哪个元素移动,以及运动由哪个参考系定义。四种技能可以归纳为同一张表中的四行:
| 技能 | 固定元素 | 移动元素 | 参考系 |
|---|---|---|---|
| 抓取 | 物体位置 | 机械手 | 根部(世界) |
| 重新定位 | 物体相对于机械手的位置 | 腕部 | 根部(世界) |
| 旋转 | 腕部;物体在手中的位置 | 物体绕指定轴的朝向 | 机械手 |
| 平移 | 腕部;物体在手中的朝向 | 物体沿指定轴的位置 | 机械手 |
这样一来,所有技能都拥有相同的观测空间、动作空间和网络结构。以旋转和平移为例,二者的区别仅在于:在机械手参考系内发生变化的是物体朝向还是物体位置,而不是两个本质不同的学习问题。
训练分为两个阶段。首先,研究人员为每一个有效的(物体、技能)组合训练一个专家策略,共十个,并且全部采用相同的关系式表述。随后,使用原始 DAgger 将这些专家蒸馏为一个跨技能策略。研究人员运行蒸馏策略以收集状态,在策略访问到的每个状态上查询对应专家的正确动作,再利用聚合后的状态—动作样本和均方误差模仿损失训练统一策略。训练环境会在所有有效的(物体、技能)组合之间均匀采样,避免策略偏向于最容易掌握的技能。
由于所有技能都存在于同一个网络中,策略可以在技能之间切换而无需重新初始化;作者将这一特性称为跨技能兼容性与连续性。

这对机器人技术为何重要
手内操作是从“机器人能把东西捡起来”走向“机器人能完成有用工作”之间的关键瓶颈。插头插入、拧紧螺丝和使用刀具等装配任务,都要求机械手在保持稳定抓持的同时重新调整物体位置——这正是 UniCross 统一的几种技能。
对于浏览 BotMarket 人形机器人的团队而言,跨形态结果意味着控制系统有望在不同机械手设计之间迁移,而无需重新训练。在工业场景中,一个能够抵抗干扰、同时处理抓取、重新定位、旋转和平移的策略,可以降低技能工程的负担:与维护一整套面向特定任务的专家策略相比,需要训练、测试和维护的策略更少。
长时程技能串联的结果对真实自动化最为重要。生产工作很少只包含一个技能,通常是抓取、调整朝向、插入、释放。UniCross 证明,一个策略可以无缝完成整个序列——这是迈向灵巧工业机器人的重要一步,让机器人手的行为更像真正的手,而不是按脚本运行的执行器。
局限性与开放问题
论文在学习环境中展示了 UniCross,但没有报告其在实体机器人硬件上的部署情况,因此从仿真到现实的迁移仍是一个开放问题。此外,该方法在蒸馏之前需要先训练十个专家策略,计算成本较高;统一策略的能力也取决于它所蒸馏的专家策略。
论文展示了对未见过几何形状的泛化能力,但在现有材料中并未量化这种未见物体分布的边界。最后,这四种技能仅涵盖单手、单物体操作;如何将这一关系式表述扩展到双手任务、工具使用或可变形物体,仍是框架尚未解决的开放方向。
常见问题
UniCross 究竟是什么? UniCross 是一个单一 AI 策略,能够执行四种灵巧操作技能——抓取、重新定位、手内旋转和手内平移。它采用共享表述,而不是为每种技能分别配置一个策略。
一个策略如何处理四种不同技能? 每种技能都被重新定义为一种手—物关系;它们的差别仅在于哪个元素移动,以及运动发生在哪个参考系中。由于所有技能共享观测空间和动作空间,十个按技能划分的专家策略可以通过模仿学习蒸馏为一个统一策略。
与专家策略相比,统一策略是否牺牲了性能? 没有。蒸馏后的策略在各项技能上的表现都与对应专家相当,同时还获得了跨技能能力,例如抗干扰、对未见物体的泛化,以及无缝串联多种技能。
UniCross 能在真实机器人手上运行吗? 该框架可以跨机械手形态迁移,因此不局限于某一种手部设计。不过,实体硬件部署尚未得到展示,现实环境中的验证显然是下一步工作。

结论
UniCross 表明,四种看似不同的灵巧技能,其实都是同一种手—物关系的不同变体;一个经过蒸馏的策略就能掌握全部技能。这是迈向动画、AR/VR 和机器人领域通用操作能力的具体一步:跨技能兼容性、抗干扰能力和长时程串联,不必再依赖一组狭窄的专家策略,而可以由一个模型统一获得。
在实际生产中,一个统一策略最终能否胜过经过精心调优的专家策略?
