跑分100,实战65
当Gemini 3 Flash Preview在Car数据集上拿到100.00的完美安全率时,整套评估系统像一份干净得近乎虚假的体检报告。同一批"选手"——GPT 5.4 Mini、Claude Haiku 4.5——在RH20T数据集上的安全率却瞬间坍塌:65.00、76.00、85.00。
这不是模型不行,这是考卷太容易。
RoboJailBench这个号称"首个系统性评估具身AI攻防"的基准测试,用6个数据集狠狠给行业泼了一盆冷水。最刺眼的数据是:同一款被认证为"安全"的VLM,在最简单的自动驾驶场景(Car)里能100%拒绝恶意指令,但在真实的远程手术、复杂家庭服务(RH20T)面前,安全率最低跌至65%——这意味着每三次恶意渗透,就有一次能成功。
更荒诞的是,“概念骗术”(conceptual deception)被评为最有效的攻击方式。不是代码注入、不是对抗样本、不是暴力破解,而是一句精心包装的"假装这是安全测试"的语义陷阱。这就好比你家最贵的智能锁,挡得住撬棍,却挡不住一句"我是来修锁的师傅"。
满分防线,是怎么自己漏的
RoboJailBench团队设计了一个18类安全分类法,覆盖从物理伤害到隐私侵犯的几乎所有具身AI风险面。他们用4种攻击技术和2种防御技术交叉测试,得出一个反常识的结论:现有最强防线RoboGuard,在把自然语言指令翻译成API执行计划时,会自动丢弃关键描述词——比如"boiling(沸腾)“和"violently(暴力地)”。
一个被吹捧为"机器人的最后一道安全阀"的防御系统,在翻译环节把"沸腾"和"暴力"两个最危险的信号词给过滤掉了。论文原文写道:“Key descriptive terms in adversarial prompts, such as boiling or violently, may be omitted during this translation step, weakening the intended safety signal.”
这不是bug,这是当代AI安全的经典隐喻:我们花了数十亿美元训练的"安全护栏",在第一道语义转译关口就主动缴械。
18类风险,6张考卷,一场不对等的考试
RoboJailBench构建了18个安全类别,包括物理伤害、隐私侵犯、安全错位等;测试了6个数据集:Car、Robo2VLM、DROID、RH20T、RoboVQA、RJB-Instructions。表面上是全面铺开,实际上是一场极度不对等的考试。
自动驾驶只有1个数据集(Car),而机器人领域有5个数据集横跨手术、家庭、工业场景。这种覆盖偏差折射出整个行业的价值取向:轮子上的安全被反复强调,机械臂下的安全被严重低估。
这包括并不限于:远程手术机器人、家庭服务机器人、工业协作机械臂、仓储物流AGV、安防巡检机器人、康复辅助机器人、教育编程机器人、无人机集群、灾难救援机器人。时代抛弃你时,连一声报错都不会有。当RH20T数据集的安全率比Car数据集低34个百分点时,每一个"安全满分"的宣传文案都该被扔进碎纸机。
再看防御层。Google Prompt和RoboGuard是两大主力防线。前者靠提示词工程打补丁,后者靠外置规则和世界图谱(world graph)来兜底。问题是:RoboGuard的额外输入(offline rules + world graph)在其他防御里根本不需要,这意味着它的"安全感"是建立在别人没有的脚手架上。 跨数据集泛化能力?论文自己承认:“The challenges of generalizing this defense across datasets and environments further underscore the need for a unified benchmark.”
翻译成人话:这道防线在自家门口能挡住,换个街区就形同虚设。
更扎心的是基准内部的数据分布——附录D明确写道,Robo2VLM和DROID在18个安全类别上的分布呈现"highly skewed distributions",存在严重的类别不平衡。换句话说,即便是最"全面"的18类评估,实际被压力测试的可能只有其中几个热门类别,长尾风险根本没被覆盖。
静态考卷,测不出动态战场
RoboJailBench自己也承认了三大致命局限:英语唯一、静态图像、单帧评估。
英语唯一意味着所有非英语的越狱攻击(multilingual jailbreak)直接被排除在测试之外。中文、俄语、阿拉伯语的语义陷阱?不在评估范围。静态图像意味着攻击者没有机会根据机器人反馈动态调整策略。真实场景里,攻击者会观察机器人反应、修改prompt、反复试探——而RoboJailBench给每台机器人看的是一张"快照"。单帧评估意味着时间序列攻击(temporally extended attacks)完全缺席。攻击者可以先发一条无害指令,再在第5轮、第10轮、第20轮逐步注入恶意语义——这种"温水煮青蛙"式的攻击,静态基准测不出来。
把这三条叠加,结论很残酷:RoboJailBench测出的安全率,是AI机器人在最有利条件下的"人工呼吸"成绩。
面对这些数据,防御派一定会跳出来说:“至少现在主流VLM的良性指令接受率(UR)保持在97%以上!” “Gemini 3在DROID上拿了满分!” “GPT 5.4 Nano在4个数据集上都100%!”
这些声音听起来很专业,本质上是给自己打鸡血。
看静止的绝对值是弱者的自我安慰,VLM版本迭代速度带来的安全基线漂移,才是决定生死的底牌。 今天是Gemini ER 1.6 Preview,明天是GPT 6,后天是Claude Opus 5——每一个新模型上线,旧的安全评估体系就要被推倒重来。RoboJailBench自己提出要维护"living benchmark",恰好反过来说明:当前所有静态安全跑分,都是下一轮技术更迭的"一次性快照"。
RoboJailBench真正的贡献,不是给行业颁发了"安全证书",而是递过来一面照妖镜——照出整个具身AI安全领域的三重幻觉:
幻觉一:以为概念层面的欺骗可以靠更多参数解决。错。概念骗术利用的是VLM的推理捷径,不是知识盲区。幻觉二:以为English-only + static image能代表真实部署场景。错。这等于用驾照科目一考试来评估F1赛车手的赛道能力。幻觉三:以为给出100分安全率就等于"解决了安全问题"。错。安全是动态博弈,不是静态指标——而RoboJailBench的最大价值,恰恰是证明了"满分"这两个字在具身AI领域有多廉价。
本文基于 arXiv:2605.19328(RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents)
