保障基础模型驱动的具身智能体安全:机器人领域的攻击、防御与评估

保障基础模型驱动的具身智能体安全:机器人领域的攻击、防御与评估

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang +2 更多

2 分钟阅读2026年8月18日

基础模型正在重塑机器人控制回路

让基础模型变得有用的能力,也扩大了机器人可能视为决策依据的输入范围。传统机器人通常接收结构化目标、传感器数据流和固定 API;而基础模型驱动的机器人还可能读取自然语言指令、场景文字、检索到的网页或 RAG 内容、交互历史、长期记忆、其他智能体发送的消息,以及异构多模态观测。一旦这些信息进入控制回路,通常被视为“语义内容”的数据就可能获得物理层面的执行权。因此,攻击者未必需要直接攻破电机控制器、ROS 节点或执行器;只要篡改模型所信任的信息,就可能诱导系统自行生成攻击者想要的行为。

具身智能体安全为何不同于纯文本 LLM 安全

具身系统还带来了文本智能体不存在、或远不那么突出的风险。首先,环境与传感器攻击必须满足视角、距离、遮挡、光照和动力学等物理可实现性约束。其次,连续控制会造成误差的时间累积:某一步的微小偏差可能改变下一次观测,并在长时域内不断放大。再次,失误可能导致碰撞、物体掉落或不安全接触等不可逆的物理后果。第四,运行时防御必须在严格的延迟预算内完成。第五,从像素到语义状态、从语言到规划、再从规划到可执行动作的异构表示转换,会产生多个权限跃迁。因此,具身 AI 安全更适合被视为网络—物理智能体安全,而不是越狱攻击、对抗视觉攻击与传统机器人网络安全的简单相加。

Simons Foundation International 研究图片

现有综述涵盖了什么,还有哪些空白

然而,如果问题是“某种具身攻击究竟从系统的哪个位置进入”,主要依据攻击机制或模型类型进行分类,往往仍然不够明确。后门可能在训练阶段植入,却由语言、物理对象、状态模式或动作片段触发。提示注入可能来自当前用户、环境中的屏幕、RAG 文档,也可能来自另一台机器人。对抗补丁主要可能破坏感知,但也可能经过优化,用于劫持思维链或连续动作生成。如果把“后门”“提示注入”或“补丁”等标签视为顶层攻击面,就会混淆攻击是如何实施的,以及它最先跨越了哪条信任边界。

我们的视角、研究问题与贡献

我们研究以下五个问题:

  • RQ1: 如何将基础模型驱动的具身智能体表示为统一的闭环系统,并应在何处划定信任边界?
  • RQ2: 当前攻击最常针对哪些信任边界?攻击机制又如何跨层传播并进入物理执行?
  • RQ3: 现有防御部署在哪里?防御覆盖范围是否与暴露攻击面的分布相匹配?
  • RQ4: 当前模型层、规划层、动作层和物理层采用了哪些指标?还缺少哪些闭环指标?
  • RQ5: 随着长期记忆、世界模型、端到端 VLA、多机器人协作以及云边融合日益普及,哪些安全问题应当优先解决?

我们的贡献有四点。第一,我们将具身智能体建模为一个从开发与供应链延伸至物理执行的闭合信息与控制回路,并明确区分攻击进入、传播和后果。第二,我们提出包含五个层级、十二个攻击面的分类体系及判定规则,使越狱、后门、投毒和传感器欺骗等机制与系统入口相互正交。第三,我们基于 58 条攻击记录和 61 条防御记录进行定量态势分析,揭示攻击与防御关注度之间的不对称。第四,我们将分类体系与评估和部署联系起来,并围绕闭环攻击成功率、长时域因果传播、物理可实现性、来源溯源和组合式防御提出研究议程。

范围与研究对象

我们关注这样的具身系统:LLM、VLM、VLA、世界模型或世界—动作模型实质性参与感知、状态构建、任务规划、策略生成、工具使用或动作控制。范围包括分层的 LLM 规划器加技能执行器架构、基于 VLM 的导航、端到端 VLA 操作、集成 LLM 的移动机器人、多机器人 LLM 协调,以及与这些系统直接耦合的 ROS/ROS2、网络和云端模型基础设施。

为避免不加区分地纳入所有传统机器人安全研究,我们采用三个纳入层级:

  • A–核心: 直接研究具身控制回路中涉及 LLM、VLM、VLA 或 WAM 组件的攻击或防御。
  • B–相关: 主要研究 VLA、自动驾驶、视觉—语言导航,或可直接迁移至目标系统的机制。
  • C–系统扩展: 研究重点可能不是基础模型,但直接涵盖构成已部署系统一部分的 ROS、网络、多机器人或供应链边界。

这一设计使综述保持聚焦,同时保留那些否则会被人为地与基础模型驱动机器人割裂开的基础设施风险。

文献库与时间边界

本版本使用的文献库截至 2026 年 8 月 15 日,包含 58 条攻击记录和 61 条防御记录。攻击文献库包括 50 条 A–核心、3 条 B–相关和 5 条 C–系统扩展记录;防御文献库包括 36 条 A–核心、22 条 B–相关和 3 条 C–系统扩展记录。我们以基础模型驱动机器人 SoK 和 VLA 安全综述为主要种子来源,并与 LLM 智能体安全、LLM 控制机器人风险综述及世界模型安全综述进行交叉核对,同时纳入 2026 年年中的较新研究。

“近乎穷尽”不应被理解为对快速变化领域中每一篇论文的字面保证。许多 2026 年研究首先以 arXiv 预印本形式发布,其发表场所或实验细节可能发生变化。因此,我们将该文献库视为动态快照,而不是永久封闭的书目。

Schmidt Sciences 研究图片

编码字段与多标签原则

每条攻击记录至少编码以下字段:年份、发表状态、模型类型、纳入层级、生命周期阶段、攻击机制、攻击面代码、主要目标模块、攻击者访问权限、安全目标、物理或现实世界验证、评估平台、方法概述及主要结果。防御记录还额外记录防御阶段、防御机制、覆盖攻击面、目标模块、所需访问权限、防御类型和验证环境。

攻击面可以采用多标签,但必须区分主要入口面与传播面或目标面。如果恶意用户提示改变了任务规划,并最终生成危险的 API 调用,那么 AS02 是主要入口,AS08 和 AS09 是下游目标。如果攻击者直接修改机器人技能或动作 token,则 AS09 为主要攻击面。对于后门,如果恶意能力在训练阶段植入,即使部署时由语言或视觉触发,也编码为 AS01。这些规则避免把最终的物理错误一概重新标记为 AS12。

六个编码维度

我们在确定主要攻击面时使用六个互补维度:

  • 表示类型: 区分自然语言任务、原始图像、音频或 LiDAR、结构化状态、思维链或隐藏状态、任务规划、代码、JSON 或动作 token,以及 ROS 消息。
  • 生命周期阶段: 区分涉及训练、微调和模型分发的开发时威胁,与部署时的提示、传感器、状态和网络攻击。
  • 来源与权限: 确定信息来自经过认证的用户、环境、RAG 或记忆、工具、云服务,还是另一台机器人。
  • 传播范围: 区分单机器人内部失陷、机器人到机器人传播、共享记忆传播和车队级传播。
  • 安全属性: 将完整性、可用性、机密性或隐私,以及物理安全视为攻击目标,而非攻击面。

方法局限

三个局限无法避免。第一,一些近期论文仍是预印本,其发表状态或实验细节可能变化。第二,多标签编码必然涉及判断,尤其是在端到端 VLA 紧密耦合感知、推理和动作生成时。第三,论文数量衡量的是研究关注度,而非现实世界中的攻击概率;研究较多的攻击面并不自动意味着其在部署中更危险。因此,定量分析应被理解为研究密度和攻防失衡的地图,而不是现实事件频率的经验估计。

入口、传播、目标与后果

对于一次攻击,我们使用一个元组描述其入口面、传播路径、目标和后果。

该元组表示攻击者最先攻破的边界、随后发生传播或遭到攻击的表面,以及由此产生的后果。

这一划分避免依据最终结果分类。机器人因提示注入而执行危险动作,并不意味着 AS12 就是主要攻击面。只有当攻击者直接操纵轨迹、执行器指令、停止或冻结逻辑,或某个可用性边界时,AS12 才是主要攻击面。同样,恶意提示导致思维链错误,也不会自动成为 AS07 攻击;只有当推理过程或内部表示本身受到直接攻击时,AS07 才是主要攻击面。

对手能力与访问模型

现有文献涵盖从黑盒到白盒的攻击者。黑盒攻击者可以提供语言、操纵环境中的物体,或查询系统输出。灰盒攻击者可能了解系统架构、技能接口或部分状态,但无法修改全部参数。白盒攻击者可以访问模型权重、梯度、训练数据或内部表示。系统级攻击者还可能接触 ROS 话题、网络链路、凭证、云 API 或机器人间消息。物理接近性也是重要维度,因为补丁、印刷提示、三维纹理、光学信号和声学注入都取决于部署条件。

安全、安全性与隐私

我们将“安全”用于指防范有意攻击者对完整性、可用性、机密性或隐私,以及物理安全发起的攻击;而“安全性”还包括由良性感知错误、规划失误、动力学不确定性或控制不稳定导致的故障。最终物理后果可能相同,但因果关系并不相同。自然地误判障碍物是安全性故障;对抗补丁故意造成同样的漏检,则是由安全攻击引发的安全性故障。VLALeaks 进一步表明,具身模型可能泄露成员身份信息及其他隐私属性。因此,成熟的框架应分别记录攻击者、第一条边界、安全目标和物理后果。

为什么攻击面与攻击机制必须正交

攻击机制描述如何实现系统失陷;攻击面描述攻击最先从何处进入。后门可以植入训练数据、感知模型、状态表示或动作生成器中。AS05 可以承载对抗补丁、传感器欺骗、视觉触发器或部署时后门触发器。因此,我们避免使用“越狱攻击面”或“后门攻击面”等标签,而将机制作为第二个编码维度。

这种区分也适用于复合攻击。TRAP 使用物理对抗补丁,却以 VLA 思维链推理为目标;此时可以将 AS05 记录为输入面,将 AS07 记录为关键内部目标。RIPA 覆盖 OCR、音频或语音转文本,以及 LiDAR 或状态向量通道;主要攻击面取决于最早发生破坏的是原始传感器还是结构化状态。当 Prompts Control Robots 表明 AS04 环境或间接注入与 AS11 跨机器人传播可能出现在同一条攻击链中时,也应分别记录二者。

攻击研究:从首个失陷边界到物理后果

本节使用十二个攻击面回顾攻击文献。对于每个攻击面,我们关注:攻击者首先控制了哪种表示;典型机制如何运作;影响如何传播至规划和动作;以及仍存在哪些主要局限。

AS01:模型、数据与供应链攻击

AS01 涵盖训练数据、微调样本、LoRA 或适配器、检查点、第三方感知或策略模型,以及依赖组件。当恶意能力在部署前被编码时,即使运行时触发器通过语言、视觉或状态到达,主要攻击面仍是 AS01。这种对植入面和触发载体的区分,避免将所有视觉触发后门都误归类为感知攻击。

可以看到两个趋势。第一,具身后门正从显眼的语言触发器和明显不安全的输出,转向环境条件、物理对象触发器和细微的动作漂移。这类攻击很难通过有害文本过滤器发现。第二,端到端 VLA 将感知与动作生成耦合在同一个模型中,使训练时的目标能够直接把恶意行为嵌入连续控制分布,而无需生成任何人类可审计的语言规划。

核心防御难点在于,干净任务上的高性能并不能证明系统值得信任。高质量后门会专门优化,以维持良性任务的成功率。因此,标准基准和少量安全提示远远不够。更强的保障需要数据来源溯源、权重或适配器完整性验证、模型差分分析、触发器搜索,以及下游微调过程中的持久性测试。

AS02:用户指令与自然语言控制

AS02 是经过授权的用户任务通道。攻击者通过恶意自然语言、对抗性后缀、越狱、直接提示注入或语音指令改变系统原本的任务意图。它与 AS03 和 AS04 的区别在于:恶意文本经由明确被授予当前任务指定权的接口到达系统。

相关研究至少揭示了三个成功条件:模型接受恶意意图,规划器生成与之相符的计划,以及执行器能够将其实现。传统的越狱成功率通常只捕捉第一个条件。

常见问题

具身智能体安全与纯文本 LLM 安全有何不同? 具身智能体面临物理可实现性约束、时间上的误差累积、不可逆后果、严格的延迟预算,以及多次表示和权限跃迁。

分类体系如何区分攻击面与攻击机制? 攻击面标识攻击最先进入系统的位置,而机制描述攻击是如何实现的。

文献库包含多少条攻击和防御记录? 截至 2026 年 8 月 15 日,文献库包含 58 条攻击记录和 61 条防御记录。

为什么不应根据最终物理后果确定主要攻击面? 主要攻击面是攻击者直接控制的第一条信任边界,而物理后果可能在下游才发生。

🍪 Cookie 偏好设置

我们使用 Cookie 来衡量性能。 隐私政策