智能体 | AUI 技术与产业观察

智能体


2026

Sep 9

人机回环,不该只是一次弹窗

一声 “y”,回答不了一个已经改变的世界 几乎每一场智能体演示的结尾,都是同一个画面:控制台光标跳动,弹出一行字,“Approve this action? (y/n)"。工程师敲下一个 “y”,回车,掌声响起,屏幕上的任务清单一项项被划掉。观众记住了 “自主智能”,记住了 “人工智能替人干活”,却很少有人追问:那个敲下 “y” 的人,那一刻到底知不知道自己在批准什么? 最近技术社区的讨论正在把这个问题重新摆上桌。一位拥有网络安全与医疗背景的 AI 从业者,把这段演示代码称为 “人机回环的谎言”:它假设审批人永远在线,问题永远新鲜,世界永远静止。而真实的生产环境里,审批人可能正飞在万米高空,答复要三天后才落地。等待期间,执行任 …
阅读更多
Jun 5

成群结队的虚拟实验室:一个可能彻底改变科研方式的框架

你有没有想过,如果把一群 AI 虚拟实验室扔进同一个问题里,让它们像真实科学家一样互相竞争、互相启发、互相"引用",会发生什么? 不是让一个 AI 助手帮你写论文,而是让一群 AI 实验室自己"卷"出最优解。 这篇论文的答案,可能会让你重新思考"AI 能做什么科学"这件事。 从"一个人战斗"到"一群人协作" 大型语言模型( LLM )的快速发展,已经催生了所谓的agentic virtual labs——由 LLM 智能体组成的自治小组,能够自主完成从文献扫描、提出假设、尝试解决方案、写论文到评估结果的完整研究循环。 这篇论文更进一步:把这些虚拟实验室打包成一个个"粒子",组成一个蜂群( swarm ),模拟真实科学共同体的行为。 每个粒子 = 一个完整的虚拟实验室实例。 …
阅读更多
Jun 5

AI智能体叩响金融大门:架构、应用与系统风险

2026 年, AI 领域最热的词汇已经从"大模型"悄然转向"AI 智能体"( AI Agent )。当 ChatGPT 等对话系统还在回答用户一个问题时,下一代 AI 系统已经开始自主规划、调用工具、分解任务并执行业务流程——在没有人全程监督的情况下。这种从"被动回答"到"主动行动"的跨越,正在深刻改变金融市场的运行逻辑。 一篇最新发表于 arXiv 的论文( 2603.13942 )系统探讨了 AI 智能体在金融领域的架构、应用与系统性影响。论文的核心贡献在于提出了Agentic Financial Market Model ( AFMM )——一个分析 AI 智能体如何影响市场效率、流动性和系统性风险的 conceptual framework 。研究的背景耐人寻味:论文的实证部分基于 Anthropic …
阅读更多
Mar 26

AI如何点燃可控核聚变之光

AI如何点燃可控核聚变之光 核聚变——利用氢原子核融合释放能量的过程——被科学家视为人类最终的清洁能源梦想。与核裂变不同,聚变反应几乎不产生高放射性核废料,燃料(氢的同位素氘和氚)可以从海水中提取,理论上足以为人类提供数百万年的清洁能源。然而,实现可控核聚变的难度远超多数人的想象。一个核心挑战在于:没有任何材料能够长期承受聚变反应堆内部极端的温度、辐射和中子轰击。 最近,一篇发表于arXiv的Perspective论文(2603.25777)系统梳理了人工智能在可控核聚变领域的应用现状、挑战与机遇。这篇由学术界和工业界联合撰写的文章源于2025年4月《经济学人》FusionFest圆桌会议的讨论,汇集了29位来自英国原子能管理局(UKAEA)、科技设施委员会(STFC)及多家企业和初创公司的代表观点。论文的核心结论是:AI或许不是解决聚变所有问题的灵丹妙药,但在材料开发、实时控制、数字孪生 …
阅读更多
Feb 16

RAG智能体危机:多模态记忆系统在撒谎

RAG智能体危机:多模态记忆系统在撒谎 当你的RAG智能体自信满满地回答用户问题时,你有没有想过一个问题:它检索到的那些"记忆",有多少是真正可信的? 两年前,行业普遍认为给大模型加上记忆模块就能解决"上下文不够长"的问题。于是所有人开始疯狂堆记忆容量、加检索增强、接多模态输入。但一篇来自匿名研究团队的新论文,冷不丁地给这股浪潮泼了一盆冰水——当前主流的记忆系统,正在系统性地生产"自信的谎言"。 这篇论文的核心发现,是一个被称作"视觉安慰剂效应"的诡异现象。 你的眼睛不是你以为的那样 让我们先做一个思想实验。当一个多模态RAG系统同时处理文本和图像时,如果图像本身是模糊的、带有噪声的,或者图像中的信息与文本存在冲突——模型会怎么做? 答案是:它会"编造"一个合理的解释,然后自信地输出这个编造 …
阅读更多
Feb 7

AI记性差?双层记忆破局

你有没有过这种感觉:跟一个 AI 助手聊了几天,忽然问它一件上周提过的事,它一脸茫然? 这不只是你的问题。这是当前几乎所有 AI 助手的架构性缺陷:当对话历史超过上下文窗口, AI 就开始失忆。 这个问题有一个正式的名字——“个性化问答的长程交互挑战”。最近,一篇论文提出了一个让这个问题变得几乎可以被解决的方案:双层混合记忆系统( Dual-Layer Hybrid Memory )。 问题的根源 为什么 AI 会"忘记"长期对话中的信息? 当前主流的个性化模型,本质上都是静态初始化的——用户画像、偏好、知识图谱,在对话开始前就被塞进模型,然后固定不动。这意味着, AI 只能在预设好的框架里回答问题,无法实时吸收用户在与它交流过程中产生的新信息。 当对话跨度拉长到数周甚至数月,上下文窗口的有限性就暴露了——你需要记住的东西远比窗口能容纳的多得多。 …
阅读更多
Jan 11

记忆觉醒:机器人具身探索新突破

2026 年的 AI agent ,已经能在棋盘上击败人类冠军、在代码库里修复 bug 、在谈判桌上碾压对手。但让一个机器人在房间里走三圈,问它"刚才沙发左边那幅画下面压着什么"—它会茫然四顾。 这并非因为它的视觉能力不够强。问题在于:它没有记忆。 华东师范大学与上海 AI 实验室的研究团队最近抛出一个让整个 embodied AI 社区坐立难安的问题:为什么我们的机器人能完成千般任务,却记不住自己刚才在哪? 9000 个目标与 9286 个问题 他们扔出的 benchmark 叫 LMEE-Bench ,数据量足以让任何研究者头皮发麻:9000+个导航目标、 9286 个记忆问答、 1982 条完整轨迹。这是什么概念?相当于让一个机器人在同一个房子里逛 9000 次,然后回答 9286 个关于"你见过什么、在哪见过、当时在干什么"的问题。 这近乎残 …
阅读更多

2025

Dec 3

别再堆参数了:AI 真正缺的是记忆

89.2%、 78.5%、 65.4%——三个数字单独拎出来算不上石破天惊。但如果告诉你,这组成绩不是来自一个更大的模型,而是一套"记忆外挂",你会不会重新掂量一下自己手里那张算力账单的分量? BLIP-2 、 GPT-3.5-Turbo 、 CLIP——这三位都是当下最被供奉的"全能选手",分别在 ScienceQA 、 LoCoMo 、 MSR-VTT 三项基准上代表了视觉问答、长对话、视频-文本对齐的最高水位。结果一个叫 MemVerse 的框架,仅靠"重组记忆"这一招,就把这三个不可一世的标杆全数按在地上: ScienceQA 上把 BLIP-2 甩开 7.1 个百分点,对话连贯性比 GPT-3.5-Turbo 高出 7.2 个点,视频-文本对齐把 CLIP 拉开了 6.7 个身位。换句话说,在"局部指标 …
阅读更多
Oct 15

多模态AI的"记忆黑箱"难题

你跟 AI 说:“帮我看看这张 X 光片有没有异常。“它给出了专业分析。 一周后,你说:“上周我给你看过一张 X 光片,有什么问题?“它说:“抱歉,我没有看过任何 X 光片。” 这不是 bug 。这是多模态大语言模型的原生缺陷。 现有的主流多模态模型,几乎全部采用"单次推理"架构——每一次新的输入,都是一次从零开始的推理过程。它们没有记忆,没有上下文连续性,更没有跨 session 的累积知识。 arXiv 在 2025 年 10 月发表的这篇论文,第一次系统定义了"多模态 Agent 记忆”( Agentic Memory )这一概念,并推出了一个专门用于评测多模态大语言模型记忆能力的基准——Augustus。 为什么多模态记忆是个大问题? 单模态语言模型的记忆问题已经被广泛 …
阅读更多

© 2026 Hot Ingest