本文探讨了两种端到端流水线设计方案:处理 RGB-D 输入,并向控制逻辑提供可供性图。整个任务由一套与传感器连接的小型电路系统支持,并封装在便携式框架中。两种方案面临的核心挑战相同:设计一条端到端流水线,在满足精度要求的同时,还要能够运行于功耗受限且需要实时响应的嵌入式设备上。
硬件感知神经架构搜索
HW-NAS 通常用于驱动微型、高硬件效率 DNN 模型的设计,因为它能够针对目标硬件平台定制网络架构。采用 HW-NAS 时,需要定义搜索空间、选择标准和搜索策略。
搜索空间涵盖所有符合条件的候选网络。多项研究表明,搜索空间的设计对最终性能至关重要。目前已经形成了一些广泛使用的通用搜索空间。
基于 DNN 的高效便携式 RGB-D 感知系统设计
本文考虑两种端到端流水线设计方案,用于处理 RGB-D 输入,并向控制逻辑提供可供性图。整个任务由一套与传感器连接的小型电路系统支持,并封装在便携式框架中。

两种方案面临的主要挑战都是设计一条端到端流水线,使其同时满足以下要求:a) 达到所需精度;b) 能够在满足能耗和实时性能约束的嵌入式设备上运行。
基于微调的方法
HW-NAS 也存在一些不足。首先,训练过程可能需要相当高的计算成本。其次,它依赖规模较大的标注数据集,这会限制其适用范围,因为获取用于可供性分割的标注掩码往往非常耗时。最后,可供性的定义可能因应用场景而异,从而可能需要重新训练网络。
因此,本文提出了一种不依赖 HW-NAS 的替代设计策略。其主要目标是:在一个针对 RGB 输入预训练且高度优化的架构中,通过微调引入深度信息。
新增层被整合进网络架构,其滤波器参数通过传统反向传播进行学习。这样既能优化输入映射,又能保留原有的权重配置。有人可能会认为,修改深度网络的基础层会破坏微调过程,因为重新训练通常只涉及最顶层。然而,深度图与 RGB 数据在结构上具有许多相似之处——针对 RGB 图像优化的特征同样很可能适用于深度数据。因此,优化过程可以调整低层特征并融合深度信息,同时不会显著改变原网络配置。
实验设置
代码使用 Python 编写,采用 TensorFlow 和 Keras 库。实验以两个知名数据集 UMD 和 IIT 作为基准。University of Maryland(UMD)数据集包含 7 个物体类别的 28,843 张 RGB-D 图像,每个物体都提供多个拍摄角度,因此可以评估模型处理视角变化的能力。
Italian Institute of Technology(IIT)数据集包含 8,835 张图像,涵盖不同的视角、光照条件、遮挡程度和分辨率。两个数据集包含不同的物体集合,分别作为独立基准使用。
验证集采用标准留出法从训练集中划分,测试样本从未用于参数或超参数调优。
在微调方案中,采用 MobileNetV3 作为骨干网络。MobileNetV3 的计算需求相对较低,同时在 ImageNet 分类等标准计算机视觉任务中保持了令人满意的性能。模型检查点在 ImageNet 数据集上预训练,并从 Keras 应用仓库下载。原始工作中描述的同一分割头也被整合到该架构中。NAS 最终选定架构所使用的设置,同样应用于微调方案。
网络的硬件需求通过参数量和 FLOPS 进行估算。这些指标不依赖具体部署设备,因此能够提供一种与目标设备无关的估计。不过,基于硬件在环的目标设备测量结果,可能会因具体 SDK 不同而呈现不同趋势。
高效利用深度信息
本文通过分析泛化性能和硬件需求,评估所提出方法高效利用深度信息的能力。图 2 展示了在 UMD 数据集上,两种方案利用深度数据时取得的泛化性能。在两种情况下,雷达图都给出了三个类别的准确率及平均分类得分;同时对比了使用 RGB-D 数据和仅使用 RGB 数据的端到端流水线。

对于 HW-NAS 方案,在不使用深度信息的实验中,通过移除深度骨干网络简化了搜索空间。加入深度信息后,所有类别的准确率均有所提升。其中,'Grasp' 和 'Don't Grasp' 类别的提升最为明显,均达到 2.8%;这两个类别通常也更具挑战性。
对于基于微调的方案,使用深度数据的网络在 'Grasp' 和 'Don't Grasp' 类别上的表现分别比基线高出 2.6% 和 3.6%。在 'Background' 类别上,准确率仅出现 0.3% 的轻微下降,这可能源于优化过程中的统计波动。两组实验都证实,深度信息有助于提升模型的泛化性能。
输入尺寸对性能的影响
FLOPS 仍然是估算推理时间的最佳设备无关指标。计算单元中的核心数量越少,该估算通常越可靠。例如,在微控制器上,FLOPS 与推理时间之间的相关性接近 1。
输出分析
深度传感器对可供性分割的实际影响,可能会因物体不同而产生显著差异。研究人员使用 Unreal Engine 5 生成的测试集进行了分析。借助该设置,可以通过低成本流程生成大量异构图像:由 RGB-D 图像和可供性掩码组成的测试样本均由模拟器生成。
研究团队创建了一个包含 2,000 张图像的测试集,其中的物体属于 UMD 数据集中的同类。随后使用在 UMD 上训练的模型进行测试。结果显示,使用深度信息后,平均准确率提升了 11.5%。应用数据增强以缓解模拟器生成图像常见的跨域问题后,这一差距缩小至 4.6%。结果证实,深度数据提供的几何信息有助于模型泛化到未见过的测试物体。
部署于嵌入式加速器
两种使用 RGB-D 数据的模型均已部署到一个原型系统中:Jetson Nano 连接 RealSense RGB-D 相机。RealSense 是目前应用最广泛的 RGB-D 相机之一。研究人员从可用的嵌入式加速器中选择 Jetson Nano,是因为它在性能与功耗之间实现了出色的平衡。
对比实验涉及四个模型:未经优化的 TensorFlow 版本 NAS RGBD 和 Mob3 RGBD;以及使用 TRT optimizer 和 float16 量化得到的优化版本(_opt)NAS RGBD 和 Mob3 RGBD。
所有延迟和内存使用数据,均来自对相机采集的 RGB-D 图像完成 100 次推理的结果。除非另有明确说明,文中报告的指标均为平均值。内存使用情况通过操作系统工具进行监测。功耗则使用功率计记录电路板电源输入端的电流。视角条件与硬件需求关系不大,因为后者与输入图像无关。
第一项分析评估了 Jetson Nano 在两种功耗配置下的模型推理时间:5W 和 10W。两种情况下的数值都对应估计的最大峰值功耗。表格列出了每个测试模型处理一帧图像所需的时间,以及以每秒帧数表示的帧率。
结果表明,优化显著降低了两种模型的推理时间。两个优化版本的推理时间均低于 120 ms,能够支持较快的处理速度,适合面向人类用户的实时操作。
结论
本文分析了将可供性分割部署到可穿戴感知系统中的两种设计策略。结果表明,与仅使用 RGB 相机的方案相比,将 RGB-D 传感器纳入感知流水线能够提升泛化性能。在两个知名真实世界基准数据集上的大量实验分析证明,所提出的策略可以生成同时兼顾泛化性能和硬件需求、位于 Pareto 最优前沿上的架构。采用这些策略生成的架构,在基于 Jetson Nano 和 RealSense RGB-D 相机的原型系统上运行时,能够以可接受的功耗实时处理图像。
当前版本的系统使用前景图像进行评估,并将正确取景的任务交给最终用户,这可能带来一定困难。未来版本将加入物体定位能力,从而简化取景过程。此外,后续实验还将把相同技术应用于 Transformer 模型:一方面设计专用搜索空间,另一方面针对采用位置编码的模型调整微调方法。研究团队还需要开展临床试验,以确认用户在半自主流水线中感知到的实际收益。届时,所提出的系统将被纳入完整控制流水线,从而深入分析高效的可供性分割如何改善用户交互。
常见问题
本文针对 RGB-D 可供性分割探索了哪两种主要设计策略? 本文探索了硬件感知神经架构搜索(HW-NAS)和基于微调的方法。后者通过添加可学习的输入层,使预训练 RGB 模型能够融合深度信息。
深度信息在类别层面带来了多大幅度的准确率提升? 使用 HW-NAS 时,深度信息使 'Grasp' 和 'Don't Grasp' 类别的准确率最高提升 2.8%;使用微调方案时,提升幅度为 2.6%~3.6%。'Background' 类别的准确率基本保持不变。
这些模型能否在嵌入式硬件上实时运行? 可以。两个优化模型在配备 RealSense RGB-D 相机的 Jetson Nano 上,推理时间均低于 120 ms,能够支持面向人类用户的实时运行。
该系统未来有哪些发展方向? 未来工作将加入物体定位以简化取景,将相关技术扩展到 Transformer 模型,并开展临床试验,在完整的半自主控制流水线中评估用户收益。
