May 19
概念骗术撕开AI机器人防线
跑分100,实战65 当Gemini 3 Flash Preview在Car数据集上拿到100.00的完美安全率时,整套评估系统像一份干净得近乎虚假的体检报告。同一批"选手"——GPT 5.4 Mini、Claude Haiku 4.5——在RH20T数据集上的安全率却瞬间坍塌:65.00、76.00、85.00。
这不是模型不行,这是考卷太容易。
RoboJailBench这个号称"首个系统性评估具身AI攻防"的基准测试,用6个数据集狠狠给行业泼了一盆冷水。最刺眼的数据是:同一款被认证为"安全"的VLM,在最简单的自动驾驶场景(Car)里能100%拒绝恶意指令,但在真实的远程手术、复杂家庭服务(RH20T)面前,安全率最低跌至65%——这意味着每三次恶意渗透,就有一次能成功。
更荒诞的是,“概念骗术 …
more
more