手术机器人 AI 预测器械运动与未来组织场景

手术机器人 AI 预测器械运动与未来组织场景

Weiliang Huang, Huanrong Liu, Bob Zhang, Qi Dou, Zhen Chen +3 更多

1 分钟阅读2026年8月21日

一项新的手术机器人模型能够同时预测器械将如何移动,以及接下来 15 个时间步内手术场景将如何变化。在 SurgWMBench 上的测试显示,与一次性完成预测相比,分块式三步滚动预测提升了视觉质量和轨迹准确率,为手术运动规划提供了比单纯依赖几何信息更贴近真实情况的基础。

目录

研究人员构建了什么?

澳门大学研究团队构建了一个用于手术运动规划的联合预测模型。系统不只预测手术器械的下一个位置,还会同时预测两类相互关联的信息:未来的二维器械轨迹,以及未来手术场景的视觉表征。

视觉表征是对摄像机所观察内容进行的紧凑、机器可读的概括。它不一定对应一帧完整的未来视频画面,而是提取模型可用来推理器械与组织交互、可见性、组织形变,以及运动所引发的其他变化的信息。

模型使用过去五个时间步的视觉与运动信息作为历史输入,随后预测接下来的三个视觉—运动状态;再用这些预测结果更新历史窗口,重复这一过程,直到生成 15 步预测。这样形成的是一个短时域规划循环,而不是要求系统一次性猜完整个未来。

这项工作弥合了两个常见研究方向之间的空白:手术轨迹模型估计器械将移动到哪里,视频预测模型则估计场景之后会呈现什么样子。该系统将两项任务连接起来,使预测的器械路径能够与它预期造成的未来视觉变化一并接受评估。

研究在 SurgWMBench 上采用严格的仅历史信息协议进行评测。这意味着模型必须根据过去的观测预测未来状态,测试过程中不能接触未来信息。

模型取得了哪些结果?

主要结果是:在直接一次性预测之外,分块式预测始终表现更好。在 SurgWMBench 上生成完整的 15 步预测时,反复进行三步滚动预测同时提升了视觉质量和轨迹准确率。

这一比较之所以重要,是因为两种设置使用相同的历史信息和相同的预测时域,区别只在于如何生成未来。一次性版本在单次前向传播中预测全部 15 个视觉与轨迹时间步;分块版本每次预测三步,将结果反馈给下一阶段,再重复这一过程五次。

报告结果还显示,计划采样有助于提升长时域稳定性。训练期间,模型有时会接收自身先前的预测,而不是始终接收真实历史状态。这更接近实际部署环境:未来输入不可用,后续每一步预测都依赖模型此前的输出。

这些结果仍属初步发现,并不代表临床效果。原文报告了相对于一次性基线的改进,但所提供的文字没有给出具体基准分数,因此无法可靠地说明百分比增益或绝对误差值。现阶段最有力的结论是方向性的:联合视觉—运动预测是可行的,而短程递归滚动比一次性生成一段很长的预测更有效。

手术视觉—运动预测示例可视化

预测系统如何工作?

这个系统可以理解为一个由成对状态预测构成的递归规划循环。每个阶段的输入包括近期视觉潜在状态,以及与之对应的二维器械位置。模型处理这段历史后,同时输出一小段未来视觉状态序列和未来轨迹点。

滚动预测采用 3→3 结构:

  1. 从五个已观测的视觉—运动状态开始。
  2. 预测接下来的三个视觉表征和三个轨迹点。
  3. 从历史记录中移除最早的三个状态。
  4. 将预测出的三个状态追加到历史记录中。
  5. 使用更新后的五状态窗口预测接下来的三个时间步。
  6. 重复五次,得到未来 15 个时间步的预测。

这种设计缩短了当前输入与每次预测之间的距离。一次性模型必须直接估计每一个未来时间步,容易使视觉状态在时间上趋于平均,也可能让轨迹丢失细节。分块预测则让模型有机会反复保留短期运动特征和场景连续性。

该方法还应对了训练与推理之间的差异。在教师强制训练中,模型学习时接收的是正确的前序状态;而部署后,它接收的则是自己的预测结果。计划采样在训练中混合这两种条件,逐步让模型接触由预测生成的历史,从而减轻由此产生的分布偏移。

视觉流与运动流并非彼此独立的输出,而是相互关联。这样一来,一个在几何上看似合理、却会导向不可信视觉状态的轨迹预测,就可以被识别为较弱的联合预测。反过来,视觉上连贯的未来也必须对应一条足够准确的器械路径。

评测在相同的仅历史信息规则下比较了直接预测和递归预测:

  • 直接一次性预测:一次生成全部 15 个未来状态。
  • 分块式自回归预测:每次生成三个时间步,并将其反馈到下一次输入中。
  • 总预测时域:15 个未来时间步。
  • 历史窗口:五个视觉—运动时间步。
  • 滚动阶段数:五次三步预测。

这对机器人技术为何重要?

手术环境对运动规划尤其困难,因为动作会改变正在被观察的世界。器械可能使组织发生形变、遮挡摄像机、改变可见性,或引发出血及其他场景变化。在图像坐标中接近专家轨迹的运动,仍可能造成不真实或不安全的未来状态。

相比仅提供器械坐标,联合视觉—轨迹模型能为规划器提供更有用的信息。它可以帮助评估候选动作是否仍与预期手术场景相容,支持摄像机与器械的协同,并为闭环控制提供更丰富的预测目标。该模型也指向一种更具潜力的手术系统:规划时考虑动作可能带来的后果,而不是把环境视为静态不变。

这种方法的价值并不限于手术领域。仓储机器人、工业机械臂和协作机器人同样需要考虑动作如何改变可见性、物体位置及工作空间条件。评估实体自动化方案的团队可以浏览二手工业机器人在售二手协作机器人,同时思考其规划软件究竟只预测运动,还是也预测由运动造成的场景变化。

对于手术机器人而言,这项技术近期更可能用于仿真、规划辅助和基于模型的监测。该系统还不是临床控制器,但它为构建连接感知、动作与未来状态估计的世界模型提供了一条路径。

有哪些局限与未决问题?

这项研究明确属于初步工作,而且随着预测时域延长,性能会因误差累积而下降。每个滚动阶段都部分依赖先前生成的状态,因此一个很小的视觉或轨迹错误,也可能影响后续所有预测。

此外,预测对象是二维器械轨迹,无法完整描述手术机器人的三维位姿、受力、速度或接触状态。视觉潜在表征能够以紧凑方式描述场景,但并不能自动保证未来图像具有照片级真实感或物理准确性。

当前模型不会根据明确的计划动作来调整预测,也没有表示不确定性,或对器械运动与组织响应之间的物理一致性施加更强约束。团队提出的下一步研究包括引入动作条件、不确定性建模,以及改进视觉—运动一致性。临床验证、安全测试,以及与真实机器人控制器的集成,仍是必须解决的问题。

常见问题有哪些?

“联合视觉—轨迹预测”是什么意思?

它指的是同时预测未来器械位置和未来视觉场景状态,而不是把运动预测与视频预测当成两个彼此独立的任务。

为什么模型每次只预测三个时间步?

较短的预测块可以降低长距离预测的难度,并让模型反复更新历史信息。五次三步滚动预测即可组成完整的 15 步预测。

这个模型已经可以控制手术机器人了吗?

还不行。该研究只是在基准数据集上展示预测能力,并未证明其能够安全地进行现实世界控制或达到临床性能要求。

SurgWMBench 用来做什么?

SurgWMBench 是用于评测的基准数据集,用来测试系统能否仅根据历史信息预测未来的手术视觉与运动状态。

结论是什么?

这项研究表明,当模型同时预测器械运动及其造成的视觉后果时,手术规划可以得到改善。与一次性预测相比,其分块式自回归设计能够生成更好的 15 步预测;不过,长时域误差累积,以及尚未纳入动作和不确定性建模,仍是重要障碍。

手术机器人规划器是否应当联合优化器械路径与预测的场景变化?

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策