这项工作的贡献主要有三点:
- 我们提出一种规划前的证据获取机制,通过提示视觉语言模型(VLM)规划信息收集子目标,揭示隐藏区域并验证与目标相关的物体。
- 我们提出一种可行性门控机制,用于评估已获取的证据是否支持可行的任务规划;当目标要求缺乏证据支持时,系统会请求更多观察,或直接停止执行。
- 我们设计了三种烹饪场景,分别对应目标明确、目标描述不充分和目标物体缺失的情况,并通过实验表明,EAFG 能提升基于真实环境的任务完成率以及不可行目标的检测能力。
相关工作
任务与运动规划(TAMP)将离散符号推理与连续运动规划结合起来,在几何、运动学、碰撞、抓取和放置等约束下,解决需要长时序操作的任务。PDDLStream 通过流(stream)扩展 PDDL,使其能够调用逆运动学求解器、抓取与放置采样器、碰撞检测器和运动规划器等黑盒过程。它协调有限的 PDDL 搜索与流评估,为候选操作规划生成并验证所需的连续参数。
关于部分可观测环境和物体搜索的既有研究,利用 POMDP、信念空间规划和信息收集动作来处理隐藏物体与不确定状态,其中包括在操作过程中揭示遮挡区域或检查容器。基于大语言模型的执行前规划验证可以检测机器人规划中的逻辑或流程缺陷,但不会主动收集有关隐藏物体或缺失物体的证据。相比之下,我们的方法使机器人能够自主获取证据,并依据这些证据决定是进行规划、获取更多证据,还是停止执行。
总体而言,既有工作分别通过 TAMP 提供几何可行性、通过基础模型进行语义任务分解,或通过部分可观测规划实现信息收集。我们的贡献在于将证据获取置于任务规划之前,并把获取到的观察结果作为明确的可行性门控依据,用于支持基于真实环境的规划或触发停止。
证据获取与可行性门控
我们提出证据获取与可行性门控(Evidence Acquisition and Feasibility Gating,EAFG)框架,利用 VLM 在任务规划前主动获取观察证据,以验证与目标相关的物体及环境条件。EAFG 会生成证据获取子目标,用于消除缺失或不确定的信息,并利用获取到的证据判断是否应继续为目标进行规划。如果在探索与目标相关的区域后仍无法获得必要证据,EAFG 将停止执行,避免基于未经证实的假设生成规划。
概览
EAFG 以自然语言目标为输入,生成一套获取环境信息的计划,用于判断目标是否能够实现。输入是一个自然语言任务目标。
VLM 首先提出一系列证据获取子目标,每个子目标都是一种探索动作,例如打开门或柜门、暂时移开遮挡物体。这些子目标的目的是检查环境中可能存放目标相关物体的区域,而不是直接执行目标任务。
每个生成的证据获取子目标都会传递给 TAMP,由其尝试将子目标实例化为几何和运动学上可行的动作序列。随后,机器人执行生成的动作序列。每完成一个子目标,系统就会将得到的观测图像保存为视觉证据,供后续 VLM 推理使用。
每轮证据获取完成后,VLM 会接收执行历史和观测图像拼图,更新证据状态,并输出一种门控状态:ready_to_plan、need_more_evidence 或 halt。第一种状态会触发基于证据的任务规划,第二种状态会触发新一轮证据获取,第三种状态则表示在必要证据仍未得到支持时停止执行。

可行性门控
如果 VLM 判断已获取的证据足以支持目标规划,就会输出 ready_to_plan。目标代表机器人需要完成的任务。 此时,系统退出证据获取循环,进入基于证据的规划阶段。
厨房环境与机器人本体
我们使用一个制作鸡汤的厨房环境。该任务要求机器人进行长时序规划,包括搜索初始可见区域之外的物体、打开储物空间、放置食材和调味料,以及使用水和炉灶。
环境中包含五个可移动物体、八个支撑表面(如台面、炉灶炉盘、水槽和锅)、两个由柜门或抽屉封闭的储物空间,以及六个可动关节物体(如门和旋钮)。只有当物体出现在机器人的观测图像中后,它才会被加入 PDDL 问题。该环境曾被 VLM-TAMP 用作评估长时序任务规划和几何可行性的基准。

在我们的实验中,所有柜门和冰箱门初始时均处于关闭状态。鸡腿位于冰箱顶部搁板上;从机器人的视角看,盐瓶和胡椒瓶分别位于橱柜的左侧和右侧。
机器人只能使用左臂,因此物体重新摆放、储物空间访问以及可动关节物体的操作都必须在有限的可达工作空间内完成。机器人可以通过抓取与放置动作操作可移动物体,也可以通过拉、推以及旋转手腕来操控可动关节。
因此,要成功完成烹饪相关操作,机器人必须同时处理未观测区域、关闭的储物空间和几何约束。
结果
我们在三种设置下,对比启用和不启用 EAFG 的 VLM-TAMP,评估 EAFG 的作用。
在目标描述不充分的 S2 中,EAFG 带来的收益最大:由于发现了任务相关但指令中未提及的盐和胡椒,并将其纳入任务规划,GPT-5.5 的 Recipe CR 从 0.05 提升到 0.40,Gemini-3.5-Flash 则从 0.00 提升到 0.20。
在 S3 中,EAFG 改善了不可行目标的处理能力:面对缺失的胡萝卜,它提高了 Halt SR,并减少了不必要的执行尝试。
在指令明确且所有必需物体均存在的 S1 中,EAFG 的表现仍与基线相当,并提升了 GPT-5.5 的 Recipe CR。
局限性
EAFG 依赖 TAMP 将每个证据获取子目标实例化为几何和运动学上可行的底层动作序列。然而,EAFG 没有明确处理证据获取过程中发生的操作失败及其恢复。
因此,当 TAMP 失败时,系统可能无法在环境中获取相关任务证据,导致可行性门控只能依据不充分的信息评估可行性。
尽管存在这一局限,EAFG 仍可兼容多种将 VLM 与结构化规划器结合的方法。随着底层规划和反馈机制不断进步,其鲁棒性有望进一步提升。
结论
我们提出了 EAFG 框架,在任务规划前主动获取视觉证据,并通过可行性门控决定是进行规划、继续探索,还是停止执行。
实验表明,在部分可观测环境下,EAFG 能在规划前发现与任务相关的隐藏物体,从而提升基于真实环境的任务完成率。当必需物体无法得到确认时,EAFG 还能促使系统适时停止,减少针对缺失物体进行的不必要执行尝试。
常见问题
什么是证据获取与可行性门控? EAFG 会在任务规划前主动获取视觉证据,并利用这些证据判断是否应继续规划。
VLM 可以输出哪些门控状态? VLM 可以输出 ready_to_plan、need_more_evidence 或 halt。
评估使用了什么烹饪环境? 实验使用了一个制作鸡汤的厨房环境,其中包含隐藏物体、储物空间、食材、水和炉灶。
EAFG 有什么局限? EAFG 没有明确处理证据获取过程中的操作失败,因此可行性判断可能基于不充分的信息。
