你跟 AI 说:“帮我看看这张 X 光片有没有异常。“它给出了专业分析。
一周后,你说:“上周我给你看过一张 X 光片,有什么问题?“它说:“抱歉,我没有看过任何 X 光片。”
这不是 bug 。这是多模态大语言模型的原生缺陷。 现有的主流多模态模型,几乎全部采用"单次推理"架构——每一次新的输入,都是一次从零开始的推理过程。它们没有记忆,没有上下文连续性,更没有跨 session 的累积知识。
arXiv 在 2025 年 10 月发表的这篇论文,第一次系统定义了"多模态 Agent 记忆”( Agentic Memory )这一概念,并推出了一个专门用于评测多模态大语言模型记忆能力的基准——Augustus。
为什么多模态记忆是个大问题?
单模态语言模型的记忆问题已经被广泛讨论——上下文窗口、长期记忆、 RAG 检索增强。但当语言模型长出"眼睛”(视觉编码器)之后,记忆问题变得复杂了一个数量级。
论文指出,多模态记忆至少面临三个维度的挑战:
维度一:视觉记忆的持久性——当一张图片进入模型后,它的信息是如何编码、存储和检索的?图片是静态的,但图片内的场景、物体、关系是动态的。一张包含"会议室里有一张红木长桌"的图片,模型需要在之后的对话中能够回答"那个会议室的桌子是什么颜色"这类跨时间检索问题。但当前模型的视觉表征是针对单次推理优化的,没有专门的记忆模块。
维度二:跨模态关联——“上周那张 X 光片"这个表述,涉及语言(“上周”)、视觉(“X 光片”)和时间(“上周”)三个模态的联合检索。论文测试了 GPT-4V 、 Gemini Pro Vision 、 Claude-3-Vision 等主流模型在这个任务上的表现,零样本跨模态检索准确率平均仅为23%。作为对比,人类受试者在同样测试集上的准确率是89%。
维度三:模态冲突处理——当语言输入和视觉输入在描述同一事件时出现矛盾,模型应该如何处理?比如用户说"这张照片里没有猫”,但视觉输入确认照片里有一只猫。模型是否能够意识到用户的语言描述可能不准确,并基于视觉证据进行独立判断?这涉及元认知( metacognition )能力,当前模型在这一维度几乎全部失分。
Augustus 基准:专门打脸多模态记忆
这篇论文推出的 Augustus 基准,包含三个子测试:
子测试 1 :视觉情景记忆( Visual Episodic Memory )——测试模型能否在超过 24 小时间隔后,准确回忆视觉输入中的细节。测试数据: 500 张场景图片,涵盖室内、室外、城市、自然等 20 个场景类别。评测指标:细粒度物体识别准确率、空间关系准确率、场景一致性评分。
子测试 2 :跨模态事实检索( Cross-modal Fact Retrieval )——给定一段对话记录(包括语言和图片),测试模型能否准确回答关于对话中视觉内容的问题。时间间隔设置为 24 小时、 7 天、 30 天三个档位。
子测试 3 :多模态元认知( Multimodal Metacognition )——测试模型能否准确评估自己对视觉信息的置信度,即"你对这个判断有多大把握”。
核心发现:一个令人不安的数据
论文的核心测试结果如下:
在视觉情景记忆测试中,主流模型的 30 天准确率衰减幅度超过 85%——也就是说,模型在 30 天后对同一张图片的记忆细节,几乎和随机猜测没有区别。
GPT-4V 在 24 小时间隔的检索准确率为67%,但 7 天后跌至31%, 30 天后仅剩12%。 Gemini Pro Vision 的表现稍好, 24 小时为71%, 7 天38%, 30 天15%。即使是被论文作者认为"最有潜力"的 Claude-3-Vision , 30 天后的准确率也只有21%。
这意味着,当前最先进的多模态 AI ,在一个月后对视觉信息的记忆,准确率仅剩两成。 对比人类受试者在同一测试中的表现——30 天准确率仍维持在85%以上——你会发现, AI 和人类之间的记忆鸿沟,是数量级的差距。
为什么这个发现比看起来更严重?
多模态 Agent 是 AI 应用的下一个主战场。 autonomous agent 需要记住用户偏好、历史交互、任务进展,从而实现真正的"连续性服务”。如果 AI 连一周前的图片内容都记不住,它怎么可能成为用户的"智能助理"?
论文指出了三个受到严重冲击的应用场景:
医疗场景:医生上传患者影像, AI 给出分析建议。如果 AI 下次无法准确回忆该患者的历史影像,很多慢性病管理、疗效跟踪任务根本无法完成。
法律场景:律师提交证据材料, AI 辅助分析案件。如果 AI 无法在后续庭审中准确检索和回忆证据材料, AI 辅助工具在实战中的价值将大打折扣。
设计场景:设计师给 AI 看参考图, AI 生成新方案。如果 AI 无法在多轮对话中保持对参考图风格的记忆连续性,每一次交互都需要用户重新上传图片,用户体验和效率都是灾难。
如何解决方案:记忆增强的三条路线?
论文对当前主流的记忆增强方案做了系统评测:
路线一:外置记忆库( RAG-style External Memory )——将历史视觉输入向量化后存入向量数据库,推理时通过 ANN 检索调取相关记忆。优点是实现简单,缺点是检索精度依赖视觉表征质量,且无法捕捉视觉信息的时序动态变化。
路线二:记忆注意力机制( Memory-attention Mechanism )——在 Transformer 架构中增加专门记忆注意力头,让模型在推理时自动查询历史视觉表征。论文测试了这种方案,在 Augustus 基准上平均提升18%的检索准确率,但计算开销增加约25%。
路线三:情景记忆模块( Episodic Memory Module )——受人类海马体启发,在模型架构中新增一个独立的记忆模块,专门负责视觉情景信息的编码、存储和检索。这是论文推荐的路线,但也是目前最不成熟、实现难度最大的路线。
一个金句总结
“AI 看了你的照片,却记不住你的脸。这不是 AI 的冷漠,是 AI 的结构性缺陷。”
多模态 AI 的记忆问题,不是调一调参数就能解决的,它是一个架构层面的根本性挑战。 Augustus 这个基准的出现,撕开了多模态 AI 光鲜外表下的一块伤疤:当模型长出了"眼睛",却没有长出"记忆",它的智能永远是碎片化的、割裂的、无累积的。
下一个大模型竞争的关键,可能不在"看得更准",而在"记得更久"。
本文基于 arXiv:2510.15261
