将零部件组装成最终产品对人类而言轻而易举,但要让机器人达到类似的熟练程度,仍然是一个复杂挑战。机器人装配研究横跨多个领域,应用场景多样、约束条件各异,包括机器人制造、服务机器人、医疗机器人及其应用、太空探索、考古领域的碎片化零部件重建,以及维修与修复。尽管这一领域已经得到广泛研究,机器人对先进装配能力的需求仍在持续增长。当前研究主要通过视觉感知和强化学习应对这些挑战,但这些系统是否真正表现出具备装配任务意识的智能机器人行为,仍存在争议。为使机器人操作具备这种能力,研究引入了装配任务意识和端到端学习方法。
引言
目标检测、分类和语义分割等计算机视觉工具,是赋予机器人感知能力的关键。虽然这些工具能够提供基础的场景理解,但机器人操作还需要对周围环境具备三维空间理解能力。因此,6-DoF 物体位姿估计逐渐成为机器人感知的重要组成部分,并在机器人抓取和物体放置中发挥着核心作用。
然而,多物体装配任务对上下文感知提出了更高要求。空间意识对于确定装配物体在装配前后的位姿至关重要;要以最优顺序组装物体,则需要时间意识;零部件之间的关系意识决定最终装配体的结构一致性。此外,理解重力作用下的稳定性,也是保证物理可行性的必要条件。
这些观察构成了渐进式装配任务所需任务意识的主要要素。这种意识可以理解为:实体能够感知装配配置,并推理其中的空间、时间和关系依赖。能够学习生成具备装配意识的可执行输出的模块,将极大促进机器人装配操作。这对现代机器人学尤为重要,因为它能让机器人从简单的抓取—放置操作,迈向任务感知型操作。
为此,研究提出了 PVRA——一种面向机器人装配的逐点关键点投票框架。主要贡献包括:
- 一种基于 3D 关键点的模块化学习框架,使机器人具备装配任务意识。
- 一套扩展指标,用于评测装配感知型角色分割和位姿估计。
- 在定制的物体装配数据集上实现并评估所提出的框架。
- 将所提出模型与以物体为中心的基线方法进行对比评估。
装配位姿估计
给定一组零部件,装配位姿估计(Assembly Pose Estimation,APE)旨在推断目标物体在装配体中的 6-DoF 位姿,同时满足装配约束。在缺乏零部件语义先验的情况下,APE 可以定义为广义零部件装配。
广义零部件装配能够根据目标装配体组装新颖或未见过的物体。GPAT 通过目标分割解决这一问题:网络显式分割目标蓝图,并推断装配位姿。然而,GPAT 假设 APE 是全局且单步完成的,因此忽略了渐进式装配任务中的中间步骤。由于缺少渐进式推理和物理约束的纳入,这会降低执行渐进式装配任务的可行性和准确性。
所提出的方法
PVRA 是一种有监督的 RGB-D 点云模型,用于在论文所述特定假设下执行渐进式装配。

该方法接收装配场景的 RGB-D 输入并提取特征,学习从输入到装配任务感知型可执行输出的映射。这些输出包括:
- 逐点语义角色:目标、基座和背景。
- 目标物体的 6-DoF 位姿。
- 6-DoF 装配位姿。
PVRA 模型并不是一个能够完整执行装配任务的控制器。相反,它预测具备任务意识的可执行输出,使下游任务能够驱动自主智能体,在渐进式装配的当前步骤执行装配动作。
该模型沿用了 PVN3D 的 RGB-D 特征融合策略,但采用了面向渐进式装配任务设计的预测头和监督信号。
实验设置
PVRA 在 Nema17 减速器渐进式装配数据集上进行训练和验证。该数据集包含模拟装配场景、物体真实位姿、装配位姿、每个装配步骤的 RGB-D 帧,以及相关物体的 CAD 文件。

数据集包含 431 个装配实例,每个实例含有五个装配物体和四个装配步骤,共生成 8,620 个实例,并按 60%/20%/20% 的比例划分为训练集、验证集和测试集。
网络在一个高性能计算集群上训练,该集群配备四块 NVIDIA Tesla V100 GPU,总显存为 128 GB。源代码托管在 GitHub 仓库中。
评测指标
步骤分割准确率
步骤分割准确率(Step-Segmentation Accuracy,SSA)通过目标角色和基座角色的平均交并比(IoU),衡量装配步骤级别的分割准确性。该指标反映 PVRA 能否结合时间和关系意识,识别当前处于活动状态的目标物体与基座物体。
步骤定位准确率
步骤定位准确率(Step-Localization Accuracy,SLA)使用归一化的最大对称性感知表面距离(MSSD)衡量位姿准确性。研究为所有 Nema17 物体定义了连续局部对称性,因此不会惩罚具有等价性的旋转。
公式使用目标物体直径对对称性感知表面距离误差进行归一化。
讨论
评估采用的是渐进式装配的合成数据集。部署到真实世界后,可能还会面临传感器噪声、标定误差、反射和光照条件等额外挑战。
尽管领域迁移能力仍有待未来研究,但基于仿真的基线对比,为基于感知的渐进式装配提供了重要且可复现的基准。正如文献调研所显示的,能够呈现渐进式装配过程的真实世界结构化数据集仍然十分有限。这是因为在真实环境中采集同步 RGB-D 帧并标注 6-DoF 位姿十分复杂。
因此,这种受控设置对于隔离方法学问题至关重要:具备装配上下文意识的模型,能否达到与现有以物体为中心的位姿估计方法相当的性能?
结论
本研究提出了一种面向任务、基于关键点的渐进式机器人装配框架,并将其与现有以物体为中心的感知方法进行了量化比较。评估结果证实,该模型能够学习装配任务特有的依赖关系,并为机器人操作生成准确的可执行输出。
此外,本研究也推动了从装配专属意识向更广泛任务专属意识学习的拓展,这将使超越渐进式装配范畴的更多机器人操作应用受益。
本项目获得赫尔辛基物理研究所技术计划通过 ROBOT 项目提供的资助,以及芬兰研究委员会通过 PERFORM 项目提供的 369003 号资助。作者感谢芬兰 CSC——科学信息技术中心提供的计算资源。
常见问题
什么是 PVRA?
PVRA 是一种有监督的 RGB-D 点云框架,利用基于 3D 关键点的学习实现渐进式机器人装配。
PVRA 预测哪些输出?
PVRA 预测逐点语义角色、目标物体的 6-DoF 位姿,以及其 6-DoF 装配位姿。
用于评估 PVRA 的数据集是什么?
该框架在 Nema17 减速器渐进式装配数据集上进行评估。数据集包含模拟场景、RGB-D 帧、物体位姿、装配位姿和 CAD 文件。
哪些挑战可能影响真实世界部署?
真实世界部署可能会受到传感器噪声、标定误差、反射以及不断变化的光照条件影响。
