相关工作
近年来,灵巧抓取规划的进展主要由数据驱动方法推动。
实现细节
计算效率
物体无关建模的一大优势在于数据生成速度快。整个数据集的创建过程仅需在单块 Nvidia RTX 4090 GPU 上运行约 1 小时。相比之下,已有工作使用 Nvidia A100 GPU 生成数据,耗时长达 1,400 GPU 小时。

抓取姿态约束与生成
该方法的一项关键优势,是能够灵活设定物体姿态。物体姿态定义了物体相对于夹爪的位置和朝向。
在实际抓取场景中,夹爪与物体之间的相对变换通常受到任务要求和物理环境的约束。因此,生成物理上不可行的抓取姿态会降低效率。此外,对于具有平移或旋转对称性的物体(例如绕自身旋转轴转动的圆柱体),只需推断一次抓取姿态,便能有效完成抓取,因为单个姿态就可以对应此类物体的大范围有效抓取构型。
抓取姿态生成策略
为实现全面的抓取覆盖,尤其是针对缺乏明显对称性的物体,我们提出了一种抓取候选生成策略。我们在物体凸包上均匀采样夹爪姿态,并将凸包向外膨胀至原尺寸的 110%。夹爪掌部朝向与凸包法向量相反的方向。该方法确保生成的抓取姿态既具有多样性,又能均匀分布于物体表面。

评估指标
效率
我们通过计算生成单次抓取所需的平均时间来评估所有模型的效率。该指标以生成 100 次抓取的总耗时为基础,其中包括模型推理和优化阶段,再将结果归一化为单次抓取的耗时。Isaac Gym 仿真所需时间不计入该指标。
真实机器人实验
我们在一台 7 自由度机械臂上安装 Allegro Left Hand,并开展了实验。实验成功抓取了 YCB Dataset 中的 11 个物体,展示了该方法向真实物体迁移的能力。论文中给出了成功抓取的示例,也展示了实验装置。实验视频见补充材料。

结论
本文提出了 GOAG,一种面向数据驱动抓取规划器的新型学习范式。该方法发挥深度学习的优势,同时摆脱了对大规模物体专属抓取数据库的需求。通过采用以夹爪为中心、且不对物体形状作任何假设的训练阶段,我们的模型学会了具有泛化能力的抓取策略。
在多个基准上的广泛评估表明,即使未使用其他方法的专属数据集进行训练,我们的方法仍能达到具有竞争力的性能。这凸显了该建模方式出色的泛化能力;我们还通过成功部署到真实机器人上进一步验证了这一点。
常见问题
什么是 GOAG? GOAG 是一种面向数据驱动抓取规划器的学习范式,采用物体无关、以夹爪为中心的训练方法。
GOAG 数据集的生成效率如何? 整个数据集仅需在单块 Nvidia RTX 4090 GPU 上运行约 1 小时即可创建完成。
如何生成抓取候选? 在物体周围向外膨胀至 110% 的凸包上均匀采样夹爪姿态,并使掌部朝向与凸包法向量相反的方向。
GOAG 是否在真实机器人上进行了测试? 是的。安装在 7 自由度机械臂上的 Allegro Left Hand 成功抓取了 YCB Dataset 中的 11 个物体。
