逐点关键点投票助力任务感知型渐进式机器人装配

逐点关键点投票助力任务感知型渐进式机器人装配

Kulunu Samarawickrama, Roel Pieters

1 分钟阅读2026年8月22日

将零部件组装成最终产品对人类而言轻而易举,但要让机器人达到类似的熟练程度,仍然是一个复杂挑战。机器人装配研究横跨多个领域,应用场景多样、约束条件各异,包括机器人制造、服务机器人、医疗机器人及其应用、太空探索、考古领域的碎片化零部件重建,以及维修与修复。尽管这一领域已经得到广泛研究,机器人对先进装配能力的需求仍在持续增长。当前研究主要通过视觉感知和强化学习应对这些挑战,但这些系统是否真正表现出具备装配任务意识的智能机器人行为,仍存在争议。为使机器人操作具备这种能力,研究引入了装配任务意识和端到端学习方法。

引言

目标检测、分类和语义分割等计算机视觉工具,是赋予机器人感知能力的关键。虽然这些工具能够提供基础的场景理解,但机器人操作还需要对周围环境具备三维空间理解能力。因此,6-DoF 物体位姿估计逐渐成为机器人感知的重要组成部分,并在机器人抓取和物体放置中发挥着核心作用。

然而,多物体装配任务对上下文感知提出了更高要求。空间意识对于确定装配物体在装配前后的位姿至关重要;要以最优顺序组装物体,则需要时间意识;零部件之间的关系意识决定最终装配体的结构一致性。此外,理解重力作用下的稳定性,也是保证物理可行性的必要条件。

这些观察构成了渐进式装配任务所需任务意识的主要要素。这种意识可以理解为:实体能够感知装配配置,并推理其中的空间、时间和关系依赖。能够学习生成具备装配意识的可执行输出的模块,将极大促进机器人装配操作。这对现代机器人学尤为重要,因为它能让机器人从简单的抓取—放置操作,迈向任务感知型操作。

为此,研究提出了 PVRA——一种面向机器人装配的逐点关键点投票框架。主要贡献包括:

  • 一种基于 3D 关键点的模块化学习框架,使机器人具备装配任务意识。
  • 一套扩展指标,用于评测装配感知型角色分割和位姿估计。
  • 在定制的物体装配数据集上实现并评估所提出的框架。
  • 将所提出模型与以物体为中心的基线方法进行对比评估。

装配位姿估计

给定一组零部件,装配位姿估计(Assembly Pose Estimation,APE)旨在推断目标物体在装配体中的 6-DoF 位姿,同时满足装配约束。在缺乏零部件语义先验的情况下,APE 可以定义为广义零部件装配。

广义零部件装配能够根据目标装配体组装新颖或未见过的物体。GPAT 通过目标分割解决这一问题:网络显式分割目标蓝图,并推断装配位姿。然而,GPAT 假设 APE 是全局且单步完成的,因此忽略了渐进式装配任务中的中间步骤。由于缺少渐进式推理和物理约束的纳入,这会降低执行渐进式装配任务的可行性和准确性。

所提出的方法

PVRA 是一种有监督的 RGB-D 点云模型,用于在论文所述特定假设下执行渐进式装配。

PVRA 步骤定位准确率阈值曲线

该方法接收装配场景的 RGB-D 输入并提取特征,学习从输入到装配任务感知型可执行输出的映射。这些输出包括:

  • 逐点语义角色:目标、基座和背景。
  • 目标物体的 6-DoF 位姿。
  • 6-DoF 装配位姿。

PVRA 模型并不是一个能够完整执行装配任务的控制器。相反,它预测具备任务意识的可执行输出,使下游任务能够驱动自主智能体,在渐进式装配的当前步骤执行装配动作。

该模型沿用了 PVN3D 的 RGB-D 特征融合策略,但采用了面向渐进式装配任务设计的预测头和监督信号。

实验设置

PVRA 在 Nema17 减速器渐进式装配数据集上进行训练和验证。该数据集包含模拟装配场景、物体真实位姿、装配位姿、每个装配步骤的 RGB-D 帧,以及相关物体的 CAD 文件。

Nema17 装配实例 G032 的 PVRA 定性结果

数据集包含 431 个装配实例,每个实例含有五个装配物体和四个装配步骤,共生成 8,620 个实例,并按 60%/20%/20% 的比例划分为训练集、验证集和测试集。

网络在一个高性能计算集群上训练,该集群配备四块 NVIDIA Tesla V100 GPU,总显存为 128 GB。源代码托管在 GitHub 仓库中。

评测指标

步骤分割准确率

步骤分割准确率(Step-Segmentation Accuracy,SSA)通过目标角色和基座角色的平均交并比(IoU),衡量装配步骤级别的分割准确性。该指标反映 PVRA 能否结合时间和关系意识,识别当前处于活动状态的目标物体与基座物体。

步骤定位准确率

步骤定位准确率(Step-Localization Accuracy,SLA)使用归一化的最大对称性感知表面距离(MSSD)衡量位姿准确性。研究为所有 Nema17 物体定义了连续局部对称性,因此不会惩罚具有等价性的旋转。

公式使用目标物体直径对对称性感知表面距离误差进行归一化。

讨论

评估采用的是渐进式装配的合成数据集。部署到真实世界后,可能还会面临传感器噪声、标定误差、反射和光照条件等额外挑战。

尽管领域迁移能力仍有待未来研究,但基于仿真的基线对比,为基于感知的渐进式装配提供了重要且可复现的基准。正如文献调研所显示的,能够呈现渐进式装配过程的真实世界结构化数据集仍然十分有限。这是因为在真实环境中采集同步 RGB-D 帧并标注 6-DoF 位姿十分复杂。

因此,这种受控设置对于隔离方法学问题至关重要:具备装配上下文意识的模型,能否达到与现有以物体为中心的位姿估计方法相当的性能?

结论

本研究提出了一种面向任务、基于关键点的渐进式机器人装配框架,并将其与现有以物体为中心的感知方法进行了量化比较。评估结果证实,该模型能够学习装配任务特有的依赖关系,并为机器人操作生成准确的可执行输出。

此外,本研究也推动了从装配专属意识向更广泛任务专属意识学习的拓展,这将使超越渐进式装配范畴的更多机器人操作应用受益。

本项目获得赫尔辛基物理研究所技术计划通过 ROBOT 项目提供的资助,以及芬兰研究委员会通过 PERFORM 项目提供的 369003 号资助。作者感谢芬兰 CSC——科学信息技术中心提供的计算资源。

常见问题

什么是 PVRA?

PVRA 是一种有监督的 RGB-D 点云框架,利用基于 3D 关键点的学习实现渐进式机器人装配。

PVRA 预测哪些输出?

PVRA 预测逐点语义角色、目标物体的 6-DoF 位姿,以及其 6-DoF 装配位姿。

用于评估 PVRA 的数据集是什么?

该框架在 Nema17 减速器渐进式装配数据集上进行评估。数据集包含模拟场景、RGB-D 帧、物体位姿、装配位姿和 CAD 文件。

哪些挑战可能影响真实世界部署?

真实世界部署可能会受到传感器噪声、标定误差、反射以及不断变化的光照条件影响。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策