方法
该框架首先以通用任务目标为基础,预训练机器人掌握基础灵巧操作能力;随后针对富接触下游任务进行后训练。整个流程分为三个阶段:
- 在仿真环境中,以通用物体操作任务为目标,预训练灵巧操作策略。
- 通过蒸馏迁移预训练行为,并利用大规模并行的在线强化学习进行后训练;同时通过稳定的策略更新,避免灾难性遗忘。
- 将专门执行特定任务的教师策略蒸馏到基于双目 RGB 视觉的学生策略,使其无需针对真实环境进行额外训练即可直接部署。

局限性
尽管真实环境中的策略表现出与仿真中高度相似的行为,但感知仍是蒸馏过程中的主要瓶颈。失败情况往往伴随着遮挡条件下对非对称插销方向的错误估计;此外,在机械臂快速运动时,圆润的 Allegro 指尖与插销圆润侧面之间的接触区域较小,也可能导致抓取不稳定。
Flexiv-Sharpa 上的指尖触觉传感能够缓解接触状态不明确的问题,但在遮挡条件下实现稳健的、以物体为中心的感知,仍是一个尚未解决的问题。在其他平台上加装腕部摄像头和触觉传感器,或许有助于缓解这些局限。

域随机化(ADR)
当运行成功率超过 0.4 时,以下参数会在 50 个 ADR 增量中从易到难逐步调整:
- 重力: 在指定的米每二次方秒范围内逐步调整重力。
- 目标精度: 在训练过程中逐步收紧目标精度要求。
B.1 从 TaskMaps 回拉至根节点
第二项表示根据链式法则,为使叶节点加速度等于回拉后的叶节点力而需要施加的曲率力。
B.2 C-Space 吸引子
该度量是各向同性的,并根据误差范数,在最小质量与最大质量之间平滑切换。
B.8 通过 ADR 逐步调整的 Fabric 参数
有若干 Fabric 参数属于 ADR 课程设置的一部分,而不是固定采用 YAML 中的默认值:
- C-space 阻尼增益: 初始值较高,会显著平滑控制过程,使任务更容易;随着成功率提高,逐步降低该值,从而产生更具响应性的行为。
- 速度控制能量目标: 逐步调整,以扩大策略在训练中接触到的运动速度范围。
- 速度衰减: 该标量作用于 Fabric 输出的速度与关节控制器之间,也会通过 ADR 逐步调整。
因此,Fabric 并不是一个固定不变的黑盒控制器,而是课程学习的一部分。随着策略能力不断提升,Fabric 提供的正则化约束也会逐渐放宽。
G.1 行为克隆损失
行为克隆项通过 Mahalanobis 加权的 L2 距离,使学生动作分布的两个矩与教师动作分布相匹配。
对于 KUKA-iiwa7 和 Allegro 系统,教师策略固定的标准差充当逐维精度权重。教师对某个关节越有把握(即标准差越小),该关节对损失的贡献就越大。
G.2 辅助八关键点位姿损失
辅助头预测插销在世界坐标系中的八个包围盒顶点。损失为各顶点残差的 L2 范数。
G.3 总蒸馏目标
行为克隆项与辅助位姿损失项按照各自的权重系数进行组合。
常见问题
ADEPT 框架包含哪三个阶段? 依次为仿真预训练、结合蒸馏的强化学习后训练,以及面向基于双目 RGB 视觉的学生策略的教师-学生蒸馏。
真实环境蒸馏过程中的主要瓶颈是什么? 主要瓶颈是感知,尤其是在遮挡条件下估计非对称插销的方向。
ADR 如何改变训练过程? 当运行成功率超过 0.4 时,ADR 会在 50 个增量中将参数逐步从易调整到难。
辅助位姿头预测什么? 它预测插销在世界坐标系中的八个包围盒顶点。
