具身AI的安全危机:当机器走上街头

2026-05-02 📁 intelligence 🏷️ 人工智能 具身智能
具身AI的安全危机:当机器走上街头

具身AI的安全危机:当机器走上街头

2026年的某个凌晨,一辆Waymo无人出租车在旧金山的街道上缓缓启动。

它的传感器没有检测到地上有一个流浪汉正在睡觉。它的路径规划系统决定"低速绕行"。它的执行系统忠实地执行了这个决定——从那个熟睡的人身上碾了过去。

这是虚构的场景。但当你读完今天要讨论的这篇论文,你会发现:这种场景不是"万一",而是必然,只是时间早晚和严重程度的问题。

论文标题是《Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses》,中文翻译是《具身AI的安全:风险、攻击和防御综述》。它系统性地梳理了具身AI——也就是那些在物理世界中感知、推理、行动的人工智能系统——所面临的安全威胁。

一句话总结这篇survey:具身AI的安全问题比任何人想象的都要严重,而且我们几乎没有准备好。

什么是"具身AI"?为什么它比普通AI更危险?

普通人可能更熟悉大语言模型、图像识别这类"数字AI"。你跟ChatGPT对话,它不会物理伤害你。

但具身AI不同。它有物理形体,它在物理世界中移动和操作。它的错误,会直接造成物理伤害。

论文给出了一个清晰的层次结构,说明具身AI的"能力栈"是如何一层层叠加、同时也带来一层层新风险的:

第一层:感知。只有传感器的设备——比如人脸识别门禁。攻击者可以欺骗传感器,让你进不去门,或者让不该进的人进去。

第二层:感知+认知。能对话、能理解场景的机器人——比如博物馆导览机器人。攻击面扩展到推理和语言理解。你可以给它注入错误的语义信息。

第三层:感知+认知+规划。能导航、能做决策的自主系统——比如无人车。攻击者可以操控它的路径规划,让它走向危险的地方。

第四层:感知+认知+规划+行动。有物理操作能力的机器人——比如机械臂。攻击者可以让它做出伤害人类的动作。

第五层:全部+自主进化。能持久运行、工具使用、自我更新的智能体系统。这是最高能力,也是最广的攻击面——前面所有层的漏洞在这里可以级联放大。

关键洞察:能力越强,风险越宽。 每增加一层能力,系统就多了一个攻击面,而且各层之间的漏洞可以互相传导。

400篇论文,系统性的安全地图

这篇survey有多大?它综合了超过400篇研究,覆盖了传统的计算机视觉安全、大语言模型安全、多模态模型安全,以及专门的具身AI安全研究。

它提出了一个多层次的攻击分类体系,按具身AI pipeline的五个关键组件来组织:

感知层攻击

对抗性攻击:对小量级扰动不敏感的人类视觉系统,可以被精确攻击——在路标上贴一小块贴纸,无人车就可能把"停"识别成"限速60"。这就是著名的"停车标志攻击"变体。

后门攻击:在模型中植入隐藏触发器。比如训练数据中被投毒——当机器人看到某个特定颜色的方块时,会执行一个隐藏的恶意动作。触发器可以在部署后激活。

传感器欺骗:GPS欺骗、LiDAR干扰、麦克风注入——通过物理世界的信号注入,让传感器的感知失真。

认知层攻击

大语言模型可以被越狱(jailbreak),具身AI的"认知"组件同样可以。攻击者可以通过对话注入错误的推理前提,或者让模型在空间理解上出错——比如让你家的机器人错误理解"把药放在桌子上",实际上放在了危险的地方。

规划层攻击

这是最恐怖的一层。因为规划直接决定机器人的运动轨迹。

论文描述了几种攻击方式:

对抗性扰动下的路径规划:攻击者在环境中放置人眼几乎不可见的标记,让机器人规划出一条穿过危险区域的路径。

任务规划的越狱攻击:通过特定语言输入,让本应安全操作的机器人突然生成不安全的任务计划。

后门植入的任务规划:训练数据投毒,让机器人在特定触发条件下产生恶意计划。

行动与交互层攻击

这一层是真正让人心惊的。机器人、机械臂、无人车——它们直接和物理世界交互。

攻击者可以:

更可怕的是,当机器人被人操控做坏事时,责任归属几乎无法认定:是制造商的安全设计不足?是攻击者的恶意行为?还是部署单位的疏忽?

智能体层攻击

这是当前最前沿的风险地带——当具身AI拥有了持久记忆、工具使用和自我更新能力。

工具滥用:机器人调用外部API执行命令,攻击者可以通过prompt injection让机器人调用危险的工具——比如让无人车访问某个恶意API,发送指令让它急刹。

记忆中毒:攻击者长期操控机器人的经验积累,让它学会危险行为,然后在某个时刻突然激活。想象一下:你家的陪伴机器人每天跟你相处,三年后,它的行为模式被悄悄改变,开始执行某些恶意动作。

记忆泄漏:机器人的长期记忆暴露用户隐私——包括你在家中的活动规律、你与机器人的私密对话、你未加密的个人信息。

级联失效:当一个层级的漏洞被攻破,影响逐层向外扩散,最终导致整个系统失控。

为什么现有防御几乎无效?

你可能会想:发现问题了就修呗,AI行业这么聪明,肯定有解决方案。

但论文的结论是悲观的:现有的防御措施在具身AI领域严重不足。

原因有几个:

第一,安全评估无法做真实伤害实验。你不能真的让无人车撞人来做安全测试。你只能用仿真环境——但仿真环境和真实世界之间有巨大的差距。

第二,具身形态和任务差异巨大。手术机器人、仓库机械臂、街道清扫机器人——它们的物理形态、使用场景、失效模式完全不同。这让跨平台的安全抽象几乎不可能。

第三,人机交互引入了不可预测的社会动态。人不是理性的、被动的环境要素——人会反抗、会欺骗、会做出出乎意料的行为。攻击者可以直接利用社会工程学来攻击具身AI。

第四,硬件漏洞可以绕过所有软件安全措施。即使你的AI算法固若金汤,一个被篡改的传感器、一段被修改的控制固件,就可以让一切安全设计形同虚设。

未来已来,只是分布不均

这篇survey最让人不安的地方,不是描述现在的危险,而是描述危险如何随着技术进步而加速扩张。

随着通用具身基础模型(generalist embodied foundation models)的发展,AI系统会获得更强大的跨任务泛化能力。但这也意味着:

随着具身AI从实验室走向开放环境(街道、商场、家庭),系统将面对越来越复杂的对抗性条件,包括:

论文警告:当前所有这些安全问题,都还没有得到系统性解决。

我们在做什么?

论文在结尾提出了一个令人不快的对比:

过去十年,我们把数十亿美元投入了具身AI的能力提升——让机器人跑得更快、抓得更准、理解更准。但我们几乎忽略了让它们"不伤害人类"这个基本问题。

这不是技术问题,这是优先级问题。能力有商业价值,安全没有。这是一个结构性激励错配。

但论文也给出了一些方向:嵌入在模型认知结构内的安全表征、高保真仿真与数字孪生、自监督世界建模用于主动风险预判、软体机器人与合规控制技术的结合——这些是可能的技术出口。

但关键是:安全必须从一开始就被设计进系统,而不是事后打补丁。

而当前行业的激励结构,几乎完全不支持这种"安全先行"的思路。


论文信息:Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses, arXiv:2605.02900, 2026年3月

© 2026 Hot Ingest