自进化具身智能新范式和困惑

2026-02-04 📁 intelligence 🏷️ 人工智能 具身智能

实验室机器人搬到家里,为什么总会失效

过去几年,视觉-语言-动作模型(VLA)在受控环境里跑得越来越顺,RT-1、RT-2、Open X-Embodiment 等代表工作让机器人"看着图像就能动手"从概念变成了工程现实。但只要把同一套策略搬到真实家庭或道路,往往第一周还行,第二周就开始出怪事:家具挪了位置,原来训练的"找杯子"路径不再成立;传感器换了一批,标定漂移让旧特征失效;甚至机械臂只是磨损了一点关节间隙,原先严丝合缝的抓取策略就抓空。

原因不在某一个算法,而在整套具身 AI 的设计前提。现有范式几乎都默认:环境是人工设定的,记忆是预先准备好的,任务是预先指定的,化身是固定的。所有这些"给定"条件都被塞进训练前的配置里,模型只需要在这一份配置下表现好。这种 human-crafted setting 在演示视频里很漂亮,但只要任何一个前提滑出预设范围,策略就会因为训练分布和部署分布错位而失效。

所以真正要回答的问题不是"如何把策略训得更好",而是"如何让智能体在前提失效时自己调整回来"。

五个耦合的维度

顺着原因往下拆,失效不是单点问题,而是落在五个相互耦合的维度上。

记忆层面的卡点是"什么该留、什么该忘"。传统的记忆模块按写入顺序追加,按 LRU 之类规则淘汰。这意味着一个偶发但后果严重的失败(比如把药品当零食递给小孩)会被后续大量普通交互覆盖掉,等到下一次类似场景出现,智能体已经忘了上一次的教训。

任务层面的卡点是"目标被锁死"。预训练阶段目标函数固定,部署后环境变了,原来"追求回报最大化"的目标可能已经不再合理,但模型并不知道要切换目标。

环境层面的卡点是"世界模型跟不上"。DreamerV3、JEPA、Genie 这类世界模型在训练数据范围内预测得很准,但真实环境是非平稳的,道路施工、家具位置变化、季节光照漂移都会让既有预测失效。

化身层面的卡点是"硬件也是变量"。机械臂质量分布、摩擦系数、传感噪声都不是常数,但在策略训练时它们被当成常数处理,所以策略对硬件漂移几乎没有鲁棒性。

模型层面的卡点是"架构不会长大"。训练时选了某一种网络结构和某一种优化器,长期运行后这套结构本身可能成为瓶颈,而模型自己并不知道要调整架构。

更深的一层问题是:这五个维度不是独立的。化身变了,原本存下来的某些记忆就不再相关;任务换了,模型架构的优先级也跟着变;环境变了,反过来又会让既有的任务定义失效。现有具身 AI 的流程基本是单向的,所有预设汇聚到一个预训练模型;真正需要的结构是模块之间双向耦合,一个模块的变化触发其他模块的响应。

五个维度的自调整

上面五个维度的卡点,需要各自变成可调整的子系统,还需要在同一个闭环里彼此联动。

记忆子系统:让"留下什么"由相关性、不确定性、长期效用决定

针对记忆被噪声淹没的问题,业界已经走出了三条互相补充的路。自编辑这条路直接对存储内容做增删改合并,比如 SAGE 用遗忘曲线调节保留时长,Mem0 从交互历史里抽取值得长期保存的事实,Memory-R1 通过强化学习决定何时改写哪条记忆。自组织这条路改的是条目之间的关系,比如 A-MEM 用 Zettelkasten 风格的笔记网络来组织记忆,MemInsight 在情景记忆之上叠加语义结构,MemGen 把记忆编进一个随经验演化的连续潜空间。自蒸馏这条路则是把情景经验沉淀成可复用的流程或规则,比如 ExpeL 从轨迹里抽取抽象规则,AWM 存可迁移的任务流程,MUSE 用层次结构把战略级和流程级的经验分开放。

三条路合起来,记忆保留的依据就从"写入顺序"换成了相关性、新颖性、不确定性和长期效用。

任务子系统:让"该做什么"由智能体自己决定

针对目标被锁死的问题,任务自切换分成自选择和自生成两条路。自选择把任务当作调度问题,SEC、WebRL、Agent0 等工作让智能体根据学习进度从一组候选任务里挑下一步;自生成更进一步,直接由智能体自己出新题,比如 ZeroGUI 从界面状态自动生成 GUI 任务,AgentEvolver 用自问自答的方式在陌生环境里探索,WebEvolver 借助协同进化的世界模型生成自我指导的交互任务。两者在真实系统里常常并存。

环境子系统:让世界模型在分布漂移中持续更新

针对世界模型跟不上真实环境的问题,需要的不是某一个更好的世界模型,而是一种能持续更新的机制。理解型路线(DreamerV3、DreamerV4、JEPA、V-JEPA 等)侧重压缩观测到预测性潜表示;生成型路线(Genie、Genie-2、Matrix-Game-2 等)侧重显式想象未来画面。代表做法包括:EvoAgent 在长程任务里持续更新世界模型,NavMorph 在导航里做在线自适应世界建模,WorMI 在测试时组合多个领域特化的理解模型。共同点是:模型本身不再是训完就冻结,而是边跑边更新。

化身子系统:把硬件漂移纳入适应范围

针对硬件不是常数的问题,化身自适配分成自重配置、自校准、自恢复三条线。自重配置应对形态或传感器布局这类离散变化,代表工作有 GET-Zero 用图 Transformer 建模化身拓扑、Body Transformer 把化身结构编进策略、PEAC 预训练可迁移表示。自校准应对质量、摩擦、接触动力学这类连续变化,经典做法是 UP-OSI 这种带在线系统辨识的通用策略,近期扩展包括 SPI-Active 和面向腿足机器人的 OFCI。自恢复处理传感、执行或计算的突发降级,常见做法是用质量多样性方法维护多样化行为库以在损伤下快速适应。

模型子系统:让架构本身也能动

上面四个子系统都在变,模型本身如果不变也会落伍。模型自进化关注的不只是参数,而是架构、优化策略、评估标准。触发条件包括持续的退化、不断上升的不确定性、评估结果与真实表现的系统性错配。这是闭环的入口:前四个子系统的状态最终回流到这里,决定下一轮用什么架构、什么优化器、什么评估指标。

把五个子系统串成闭环

每个子系统都解决了一个局部问题,但要真正可用,必须把它们串成一个闭环。每次迭代大致按这个顺序运行:先通过化身子系统维护物理状态,通过模型子系统维护内部认知,通过环境子系统维护外部世界;基于这一组状态,任务子系统决定下一步该追什么目标,记忆子系统挑出与目标相关的经验;这些信号再回流到模型子系统,更新架构、优化策略和评估标准;最后用进化后的模型输出动作,动作落到环境里,这一圈就结束。

关键是这个循环的双向性:变化既能从环境传入各模块,也能在模块之间互相传播。化身约束变了,原本存下来的某些记忆就不再相关,这又会改变任务切换和模型进化的方向。这种跨模块的传播,正是这套范式的核心结构:双向反馈回路。

真实场景里怎么落地

前面的子系统解法还停留在抽象层面。真正检验这套范式能否落地的,是它能不能撑住分布漂移、有限监督、硬件异构同时存在的真实场景。三类典型应用是自治服务机器人、自动驾驶和自治无人机。它们的痛点和子系统组合方式各不相同,串起来正好覆盖了"自我进化"在工程层面的几种必要形态。

自治服务机器人:开放家庭里,训练数据里没有的状态

服务机器人跑在开放的人类生活空间里。家具会挪,用户偏好会变,今天说"帮我热饭",明天可能就换成"帮我收衣服"。BEHAVIOR 这类家庭基准测试也只能覆盖有限的家庭活动。RT-2 这类视觉-语言-动作模型把通用策略推进到实用水平之后,剩下的关键问题变成了:训练时没见过的事,部署时必须能处理。

这一场景里,三个子系统各管一段。记忆子系统用来识别和保留罕见但代价高的失败。比如把药品递给小孩这种事,频率低,但一旦发生就至关重要,自编辑(Mem0、SAGE、Memory-R1、Memento)让智能体能把它从大量日常交互里筛出来并长期保留。任务子系统用来应对目标漂移。自选择(SEC、WebRL、Agent0、Mobile-Agent-E)和自生成(ZeroGUI、AgentEvolver、WebEvolver)让机器人能根据用户意图和上下文重新解读"接下来该做什么",而不是死守训练时的目标函数。化身子系统用来支撑跨平台部署。自重配置(GET-Zero、Body Transformer、PEAC)让同一套策略能跨轮式底盘、四足、机械臂迁移,避免每换一个硬件就重训。

这套组合解决的问题是"在人类环境里长期自主"。BEHAVIOR 这类基准能衡量"做对一次任务"的能力,衡量不了"做对一千次任务"的能力。后者需要的不是单次最优,而是持续适应。

自动驾驶:分布漂移是常态,安全约束是硬条件

自动驾驶的环境是非平稳的,天气、路面结构、交通模式都在变;长尾场景和与人类的复杂交互在训练数据里不可能穷举。要处理这种开放性,光靠更好的策略网络不够,还需要环境自预测(DreamerV3、DreamerV4、JEPA、V-JEPA、Genie、Genie-2、Matrix-Game-2 等世界模型支持对未来事件的长期回报估算)和模型自进化(适应分布漂移)。

但自动驾驶相比其他场景多一个硬约束:化身自适配在这里特别关键。这里的"化身"不只是硬件,而是说智能体的动作必须受安全、可解释性、可靠性的约束,智能体不能为了"进化"做出违反交通规则的决策。这也是整套范式里自治与可控张力最尖锐的地方:自我进化是手段,安全合规是底线,两者之间必须有一个上层控制器。

引入第三方开源技术栈的核心动因,就是把"开放场景下的预测"和"安全边界上的控制"这两件事分别交给不同的成熟模块,而不是让一个端到端网络同时承担两件事。

自治无人机:硬件是变量本身

无人机是物理约束最紧的载体:能源受限,执行器响应有不确定性,平台之间存在异构(旋翼数、负载、传感器配置都不同)。它对应的任务是巡检、规划、搜救等需要持续适应动态环境、天气和任务目标的工作。在 GPS 受限环境下的自主导航,本身就是一个持续开放的工程问题。

这一类场景下,由于能源、执行器、平台异构的约束,化身适配必须在线运行。UP-OSI 这种带在线系统辨识的通用策略、SPI-Active 的主动校准、OFCI 在腿足机器人上的在线摩擦辨识,都是这一思路。环境自预测需要支持快速变化动力学下的轨迹想象与在线重规划。模型自进化要在机载算力有限的前提下做轻量更新。

相比地面机器人,无人机对经验轻量自更新、化身-环境-模型紧耦合演化的要求更高,正好把整套范式放进最吃紧的物理约束里测试,这是它成为第三类典型应用的原因。

还差什么:从"能自我调整"到"能安全地自我调整"

上述闭环解决的是"失效发生时系统能自己恢复",但要让这套范式真正落地,还有三个问题没有答案。

可控性。 自我进化一旦跑偏,不一定会立刻出现可见的故障,更多是持续的性能退化、目标漂移,或长尾场景里的不可预测行为。难点不在识别已经发生的偏差,而在偏差还没显现时就约束它的方向,这是一个没有标准答案的先验控制问题。当前的路径是分层控制架构:把快速控制回路和较慢的进化回路分开,控制层始终掌握安全边界,进化层在受限空间里调整;同时在进化侧定义"稳定性裕度"或"适应预算"这类可量化的判据,让可控性成为一个能监控的工程指标,而不是事后归因。

可信度。 系统长期运行后,什么变了、为什么变,外部观察者很难追溯,而具身 AI 部署的家庭、道路、空中场景,恰恰都要求可追溯。难在验证:离线测试覆盖不了进化系统长期运行后的状态空间,新的不确定性也意味着旧的安全边界不再成立。可行的做法是把可信性做进系统本身:持续监控和审计进化过程,提供可解释的反馈让人类理解发生了什么、为什么变,并配套回滚机制撤销有害的适应。这几样合起来,是"长期无人监督运行"的最低门槛。

群体扩展。 个体层面的自进化机制未必能直接推广到群体。多个智能体在共享环境里同时演化,会出现个体层看不到的耦合问题:经验怎么共享、任务怎么协调、内部模型怎么协同调整。可行的路径是引入分布式记忆、策略共享和角色分化,让群体层也有自己的进化变量;同时研究群体自进化里的涌现行为,保证群体级进化与集体目标一致,而不是各自优化到相互冲突。这条路走通,群体自进化解锁的能力才可能超过个体能力的简单加和。

这三个问题决定了这套范式能不能从实验室演示走到长期部署。

附录:参考链接

视觉-语言-动作模型(VLA)

世界模型

记忆子系统

任务子系统

化身子系统

基准与工具


Feng, T., Wang, X., & Zhu, W. (2026). Self-evolving Embodied AI. arXiv preprint arXiv:2602.04411 [cs.AI, cs.RO].

© 2026 Hot Ingest