随着机器人系统不断演进为能够进行复杂交互的具身智能体,抓取已不能再被单纯视为几何稳定性优化问题。近年来,人形机器人兴起,并越来越多地借助大型语言模型等高层推理框架进行引导,这对抓取提出了更高要求:抓取动作必须直接回应功能层面的任务意图。精细化机器人操作需要具备高自由度(DoF)的灵巧多指手,因为许多下游任务——例如手内物体重新定向、精密工具插入、手指步态调整以及基于把手的抓取——都要求可控且分布式的多点接触拓扑,而这从根本上超出了简单平行夹爪在对称捏取和包络抓取方面的能力。
引言
然而,向高自由度系统转型也暴露出现有抓取规划器的一项关键局限:它们能够生成物理上稳定的抓取,却缺乏构建与任务相匹配的接触拓扑所需的结构属性。当前以数据驱动为主的抓取规划器,主要关注物体能否被抓住,而不是应当如何对其进行操作。
由于仅以几何稳定性和力闭合为优化目标,这些方法会产生严重的生成偏置,倾向于生成能量上稳定、但在功能上高度同质化的抓取。尽管灵巧手具备丰富的关节化接触能力,现有规划器并未充分发挥其在抓取模式多样性方面的潜力,反而几乎总是默认采用包络式力量抓取。
因此,要合成下游任务所需的特定精密抓取,效率会变得极低,因为系统必须生成并淘汰数量庞大、却在功能上并不适用的候选方案。

该方法在仿真和真实环境中均进行了全面评估。评估首先通过测量当前不考虑分类体系的规划器所检索到的接触拓扑分布熵,展示其严重的功能偏置。随后,研究将 CoToGrasp 与最先进的拓扑引导方法进行比较,结果表明,CoToGrasp 在拓扑遵从性和稳定性方面均表现更优。
本文的主要贡献是 CoToGrasp:一种与物体无关的抓取规划器,能够基于源自人类分类体系的结构化接触拓扑合成抓取。为恰当评估这类能力,研究还建立了严格的评估方法,用于量化灵巧抓取规划器中固有的功能多样性与语义偏置。
方法
为成功将高层功能语义与任意物体几何形状解耦,研究采用了与物体无关的学习范式。不同于标准方法,该架构只使用夹爪点云进行训练,并在目标物体点云上进行推理。
在训练阶段,模型始终在夹爪的规范坐标系中运行,因此不受全局位姿影响。
模型采用规范化的夹爪坐标系,而不是依赖夹爪的全局位置和朝向。
网络的输入仅包括夹爪的局部表面几何信息和语义接触拓扑,并据此学习重建相应的物理接触模板掩码。

结论
本文提出了 CoToGrasp,一种以接触拓扑为条件的灵巧抓取生成框架。通过从根本上将功能意图与物体身份解耦,该方法有效缓解了当代抓取规划器中严重的模式坍缩问题。
因此,即使面对未见过的几何形状,CoToGrasp 也能合成受到严格约束且符合拓扑要求的精密抓取和力量抓取,无需依赖昂贵的物体标注数据集。全面评估表明,验证流程能够稳健地过滤拓扑无效配置,在语义多样性和物理稳定性方面达到当前最优水平。
最后,在 Allegro Hand 上开展的真实世界部署实验表明,生成的接触拓扑具有结构上的可执行性,能够在真实机器人平台上实现。
致谢
本研究得以完成,离不开 FactoryIA 超级计算机的支持;该超级计算机由法兰西岛大区委员会提供资金支持。本文所展示的实验借助由 DIM AI4IDF 和 PRAIRIE-PSAI 资助的平台完成。
作者感谢 Timothée Carecchio 为本文实验结果的实现提供的宝贵帮助。
本项目获得欧盟“地平线欧洲”研究与创新计划资助,项目编号为 101135708,隶属于 JARVIS 项目。
Liming Chen 的研究部分得到了法国国家研究署(l’Agence Nationale de Recherche)的支持,相关项目包括 Aristotle、Astérix、DEMETER 和 PROTEUS;同时还获得法国国家重点投资计划下 PSPC FAIR WASTE 项目的资助。
常见问题
CoToGrasp 解决了什么问题? 它解决了许多灵巧抓取规划器只能生成物理上稳定的抓取、却无法生成与任务相匹配的接触拓扑这一问题。
规划器以什么作为抓取条件? CoToGrasp 以源自人类分类体系的结构化接触拓扑作为抓取合成条件。
该方法如何训练? 该架构仅使用规范化夹爪坐标系中的夹爪点云进行训练,并在目标物体点云上进行推理。
CoToGrasp 是否在真实机器人上进行过测试? 是的。在 Allegro Hand 上进行的真实世界部署表明,生成的接触拓扑能够在物理机器人平台上执行。
