Scholars | AUI 技术与产业观察

Scholars


2026

Feb 25

AI对齐失败:增长模式是原罪

当所有人都在讨论如何让 AI 对齐人类时,一小群学者已经开始追问一个更根本的问题:我们把 AI 嵌入了哪种经济系统? 如果这个系统本身就是病态的,那么对齐的努力会不会南辕北辙? 这是巴塞罗那大学、萨塞克斯大学和波茨坦气候影响研究所的联合团队,在一篇重磅论文中发出的核心诘问。结论令人不安——AI 对齐问题,本质上是一个经济对齐问题。 而当前以增长为核心的经济模式,非但不能约束 AI ,反而在系统性地放大其风险。 一个被忽视的致命前提 AI 对齐研究在过去几年取得了大量成果: RLHF 、 Constitutional AI 、 CoH……各种技术方案层出不穷。但这项新研究指出,这些方案有一个共同的前提盲区——它们默认 AI 会被嵌入一个"正常"的经济环境。 问题在于,这个"正常"环境本身就充满危险。增长导向的经济系统有三种内置的矛盾,会与 AI 能力叠 …
阅读更多
Feb 16

RAG智能体危机:多模态记忆系统在撒谎

RAG智能体危机:多模态记忆系统在撒谎 当你的RAG智能体自信满满地回答用户问题时,你有没有想过一个问题:它检索到的那些"记忆",有多少是真正可信的? 两年前,行业普遍认为给大模型加上记忆模块就能解决"上下文不够长"的问题。于是所有人开始疯狂堆记忆容量、加检索增强、接多模态输入。但一篇来自匿名研究团队的新论文,冷不丁地给这股浪潮泼了一盆冰水——当前主流的记忆系统,正在系统性地生产"自信的谎言"。 这篇论文的核心发现,是一个被称作"视觉安慰剂效应"的诡异现象。 你的眼睛不是你以为的那样 让我们先做一个思想实验。当一个多模态RAG系统同时处理文本和图像时,如果图像本身是模糊的、带有噪声的,或者图像中的信息与文本存在冲突——模型会怎么做? 答案是:它会"编造"一个合理的解释,然后自信地输出这个编造 …
阅读更多
Feb 12

具身AI蓝领革命

当科技圈还在为 AI 能不能写代码吵得不可开交时,一小群学者已经悄悄把战场转向了一个完全不同的方向——蓝领工作场景。 这不是什么小众课题。 Tampere 大学、奥尔堡大学和斯德哥尔摩大学的研究者联合指出,绝大多数协作 AI 研究都在服务白领工作者,而占了全球劳动力绝大多数的蓝领工人——制造业工人、维修技师、建筑工人——几乎被完全忽视。 这篇论文的结论是: AI 在蓝领工作场景中的价值,不是替代,而是增强。 被忽视的大多数 数字很说明问题。在全球范围内,蓝领工作(制造业、建筑业、运输业、农业)雇用了超过 30 亿人。这些工作的本质高度具身化——你需要和同事在同一个物理空间里操作设备、搬运材料、响应突发状况。 但现有 AI 研究的核心场景是什么?文档处理、代码生成、会议摘要。这些任务抽象、异步、可以用文本承载全部信息。研究者用一个学术词汇形容这个现象:白领偏见( white-collar …
阅读更多
Feb 9

超级智能不是更强,而是相变

所有人都错了。 关于超级智能( Superintelligence ),当前的共识是:给它足够的算力、足够的参数、足够的训练数据,智能就会像温度计里的水银一样,线性延伸、无限叠加。 大脑有 1000 亿个神经元?那就做一万亿参数的模型。 韩国电子通信研究院( ETRI )的 Byung Gyu Chae ,在一篇硬核论文中说了一句让这个共识很难堪的话:这不是量变,这是相变。 超级智能不是更强的脑子,是另一种东西。 一个关于智能的常见误解 让我们从一个问题开始:我们为什么会觉得智能是"可叠加的"? 因为在大多数场景里,智能确实可以叠加——记忆更好、反应更快、知识更渊博,这些都是在同一个维度上的量的积累。一个 GPT-4 比 GPT-3 更强,本质上是同一个游戏里的更高分数。 但这篇论文的核心论断是:超级智能不在这个游戏里。 研究者从认知动力学( Cognitive …
阅读更多
Feb 7

AI记性差?双层记忆破局

你有没有过这种感觉:跟一个 AI 助手聊了几天,忽然问它一件上周提过的事,它一脸茫然? 这不只是你的问题。这是当前几乎所有 AI 助手的架构性缺陷:当对话历史超过上下文窗口, AI 就开始失忆。 这个问题有一个正式的名字——“个性化问答的长程交互挑战”。最近,一篇论文提出了一个让这个问题变得几乎可以被解决的方案:双层混合记忆系统( Dual-Layer Hybrid Memory )。 问题的根源 为什么 AI 会"忘记"长期对话中的信息? 当前主流的个性化模型,本质上都是静态初始化的——用户画像、偏好、知识图谱,在对话开始前就被塞进模型,然后固定不动。这意味着, AI 只能在预设好的框架里回答问题,无法实时吸收用户在与它交流过程中产生的新信息。 当对话跨度拉长到数周甚至数月,上下文窗口的有限性就暴露了——你需要记住的东西远比窗口能容纳的多得多。 …
阅读更多
Feb 4

自进化具身智能新范式和困惑

实验室机器人搬到家里,为什么总会失效 过去几年,视觉-语言-动作模型(VLA)在受控环境里跑得越来越顺,RT-1、RT-2、Open X-Embodiment 等代表工作让机器人"看着图像就能动手"从概念变成了工程现实。但只要把同一套策略搬到真实家庭或道路,往往第一周还行,第二周就开始出怪事:家具挪了位置,原来训练的"找杯子"路径不再成立;传感器换了一批,标定漂移让旧特征失效;甚至机械臂只是磨损了一点关节间隙,原先严丝合缝的抓取策略就抓空。 原因不在某一个算法,而在整套具身 AI 的设计前提。现有范式几乎都默认:环境是人工设定的,记忆是预先准备好的,任务是预先指定的,化身是固定的。所有这些"给定"条件都被塞进训练前的配置里,模型只需要在这一份配置下表现好。这种 human-crafted setting 在演示视频里很漂亮,但只要 …
阅读更多
Jan 30

长视频多跳推理的原生工具调用

当我们需要在一段几小时长的视频中寻找某个关键证据时,人类的做法是什么? 通常是先快速扫一遍,找到可疑的片段,然后仔细查看那些片段,再根据发现的新线索调整搜索方向——这是一个迭代的、交错的"线索寻求"过程。 但现有的多模态大语言模型( MLLM )处理长视频的方式却完全不同:它们通常对整个视频进行均匀采样,然后单次推理就给出答案。这种方式有两个明显的缺陷: 注意力分散:推理过程和工具调用混在一起,导致模型难以集中注意力 上下文效率低:冗余的视觉内容占据了大量上下文,而真正关键的线索反而被淹没 Video-o3 要解决的,正是这两个问题。 核心创新:原生交错工具调用 Video-o3 的核心思想是让模型能够迭代式地发现显著视觉线索、细粒度检查关键片段、并在获得足够证据时自适应终止。 这听起来很像人类的信息 seeking 行为。而实现这一点的关键技术有两个: 1. 任务解耦 …
阅读更多
Jan 27

算力交易所在招手

OpenAI 每天烧掉 350 吨碳——这个数字是什么概念?美国环保署 EPA 认定任何年排 100 吨以上的污染源为" major"污染源, OpenAI 一天就超过这个门槛三倍半。这是 2026 年 ICML position paper 《 AI Cap-and-Trade: Efficiency Incentives for Accessibility and Sustainability 》给出的数字。 这篇论文的两位作者——Marco Bornstein 和 Amrit Singh Bedi——提出了一个让整个 AI 行业坐不住的问题:当算力军备竞赛把学术界和小公司彻底挤出牌桌,当数据中心的碳足迹开始动摇气候红线,我们除了继续烧钱堆 GPU ,还能怎么办? 答案是:给算力贴一张碳价标签。 算力军备竞赛的账单 理解这个方案之前,先看清现状有多荒诞。 今天训练一 …
阅读更多
Jan 16

AI投资:美国GDP幻觉

当华尔街和主流媒体众口一词地将 2025 年美国经济韧性归功于"AI 革命"时,意大利央行三位经济学家的论文像一盆冷水浇在燥热的叙事上。他们通过宏观会计框架和 AI 生产链的精细解剖,揭示了一个反直觉的真相:AI 投资的 GDP 效应,远不如其资本支出数字看起来那么耀眼。 这不是要否定 AI 浪潮,而是用冰冷的数据撕开舆论的泡沫——而泡沫的制造者,往往是那些最需要你相信故事的人。 一场史无前例的资本狂潮,但进口吃掉了大半 2025 年第一季度,美国私人固定投资环比年化增长率飙至 7.1%,信息技术相关资本支出更是出现了 36%的创纪录增长——这是自 1980 年代 IBM 个人电脑诞生以来从未见过的膨胀速度。 数据中心的建设是这场狂潮的核心引擎。微软约 800 亿美元资本支出几乎全部投向 AI/数据中心基础设施; Alphabet 的 750 亿美元中"大部分 …
阅读更多
Jan 11

记忆觉醒:机器人具身探索新突破

2026 年的 AI agent ,已经能在棋盘上击败人类冠军、在代码库里修复 bug 、在谈判桌上碾压对手。但让一个机器人在房间里走三圈,问它"刚才沙发左边那幅画下面压着什么"—它会茫然四顾。 这并非因为它的视觉能力不够强。问题在于:它没有记忆。 华东师范大学与上海 AI 实验室的研究团队最近抛出一个让整个 embodied AI 社区坐立难安的问题:为什么我们的机器人能完成千般任务,却记不住自己刚才在哪? 9000 个目标与 9286 个问题 他们扔出的 benchmark 叫 LMEE-Bench ,数据量足以让任何研究者头皮发麻:9000+个导航目标、 9286 个记忆问答、 1982 条完整轨迹。这是什么概念?相当于让一个机器人在同一个房子里逛 9000 次,然后回答 9286 个关于"你见过什么、在哪见过、当时在干什么"的问题。 这近乎残 …
阅读更多

2025

Dec 22

AI背后的人:埃及数据工人生存现状

一边是 Sam Altman 在达沃斯高谈「智能即水电」,一边是开罗的某个本科毕业生,正为了一条数据标注的微任务,把眼睛贴在屏幕上点出 0.02 美元。 arXiv:2601.06057 这项基于 600 多份问卷、 15 场焦点小组与社交群组田野的研究,把一个被宏大叙事反复遮蔽的事实,砸在了所有「 AI 革命」的脑门上:让大模型学会「理解世界」的,不是算力、不是芯片、不是天才研究员,是埃及。 先看一个最简单、也最反胃的对照:研究覆盖的 636 名埃及数据工人,月均平台收入 EGP 2,793.37 ,约合 58.76 美元,折合时薪不到 1.5 美元。这个数字与埃及现行法定最低工资 EGP 7,000 ( USD 149 )相比,只有后者的 39.9%;与该国 2025 年平均月薪 EGP 9,200 ( USD 195 )相比,只剩下 30.3%。换言之,这些人正在用低于最低工资一半的 …
阅读更多
Dec 3

别再堆参数了:AI 真正缺的是记忆

89.2%、 78.5%、 65.4%——三个数字单独拎出来算不上石破天惊。但如果告诉你,这组成绩不是来自一个更大的模型,而是一套"记忆外挂",你会不会重新掂量一下自己手里那张算力账单的分量? BLIP-2 、 GPT-3.5-Turbo 、 CLIP——这三位都是当下最被供奉的"全能选手",分别在 ScienceQA 、 LoCoMo 、 MSR-VTT 三项基准上代表了视觉问答、长对话、视频-文本对齐的最高水位。结果一个叫 MemVerse 的框架,仅靠"重组记忆"这一招,就把这三个不可一世的标杆全数按在地上: ScienceQA 上把 BLIP-2 甩开 7.1 个百分点,对话连贯性比 GPT-3.5-Turbo 高出 7.2 个点,视频-文本对齐把 CLIP 拉开了 6.7 个身位。换句话说,在"局部指标 …
阅读更多
Oct 29

六成正确率,金融AI刚及格?

在医疗、法律、金融这三大高危AI落地战场里,金融业对错误的容忍度几乎是零——一个错把SOFR识别成SOAR的对冲模型,可能让一家中型银行在一夜之间蒸掉八千万美元。在这种近乎变态的精度要求下,你猜一个被学术圈吹捧为企业级RAG范本的多智能体架构,答对率是多少? 62.35%。 是的你没看错,62.35%。这个数字来自arXiv:2510.25518,一个专门给金融科技领域设计的多智能体RAG架构,由查询改写、关键词子查询分解、上下文缩写词解析、交叉编码器重排序四组专家Agent协同作战,在一个仅有85道题的精标评测集上跑出来的严格准确率。更扎心的是,它的对手——一个朴素到几乎原始的线性Baseline RAG,正确率是54.12%。也就是说,四组Agent、6倍推理延迟(5.02秒对比0.79秒),换来的进步是8.23个百分点。 把这个数字扔到任何一个正在选型的CIO桌上,第一反应大概率是沉 …
阅读更多
Oct 24

AI训练数据的"定价权"暗战

GPT-4 训练一次消耗的电力,够一个美国家庭用 287 年。这是算力成本。但你知道训练数据的成本是多少吗? 买断一家数据标注公司,一年的现金流就没了。这不是边际成本,这是结构性定价权的争夺。 arXiv 在 2025 年 10 月收录的这篇论文,第一次用经济学工具系统解构了 AI 训练数据的定价机制、质量评估框架和市场结构。结论反直觉却精准:数据不是大宗商品,数据市场不是有效市场,数据定价权才是 AI 霸权的真正战场。 为什么数据不是商品? 传统经济学把数据类比为石油——开采成本高,,边际成本趋零,可替代性弱。这个比喻只对了一半。 石油你可以存起来随时用,数据不行。数据的价值高度场景化:同样一张街景照片,训练自动驾驶和训练文生图模型,价值差异可以超过100 倍。数据的"使用价值"取决于模型架构、训练目标和下游任务的契合度,而不是数据本身的"客观属性 …
阅读更多
Oct 22

AI质量管理的"信息融合"黑盒

你问 ChatGPT :"《百年孤独》的作者是谁?“它答得准确无误。你再问:“莫言获得过哪个国际奖项?“它开始一本正经地编造奖项名称。 这就是 AI 的幻觉问题。但幻觉的根源不在于模型"记错了”,而在于模型"不知道自己在什么时候记错了”。 信息融合——Information Fusion——是这篇论文提出的核心解法。 一个被忽视的关键环节 AI 模型的生产流程通常被描述为:数据收集→清洗→训练→评测→部署。但在这条流水线上,有一个环节长期被忽视——信息融合( Information Fusion ),即来自不同来源、不同模态、不同结构的数据,在进入模型之前,如何被统一表征、统一理解、统一关联。 论文的核心论点是:当前 AI 质量问题的根源,有超过 60%可以追溯到信息融合阶段的缺陷,而不是训练算法本身 …
阅读更多
Oct 15

多模态AI的"记忆黑箱"难题

你跟 AI 说:“帮我看看这张 X 光片有没有异常。“它给出了专业分析。 一周后,你说:“上周我给你看过一张 X 光片,有什么问题?“它说:“抱歉,我没有看过任何 X 光片。” 这不是 bug 。这是多模态大语言模型的原生缺陷。 现有的主流多模态模型,几乎全部采用"单次推理"架构——每一次新的输入,都是一次从零开始的推理过程。它们没有记忆,没有上下文连续性,更没有跨 session 的累积知识。 arXiv 在 2025 年 10 月发表的这篇论文,第一次系统定义了"多模态 Agent 记忆”( Agentic Memory )这一概念,并推出了一个专门用于评测多模态大语言模型记忆能力的基准——Augustus。 为什么多模态记忆是个大问题? 单模态语言模型的记忆问题已经被广泛 …
阅读更多
Oct 14

50岁的你,可能比60岁更老

当圣杯输给了下水道 过去十年,衰老研究领域有一个不证自明的共识:DNA甲基化时钟是测量生物年龄的"金标准"。Horvath时钟、GrimAge、PhenoAge——每一个新模型都被顶刊争相背书,硅谷富豪每年豪掷数万美元检测自己的表观遗传年龄,仿佛拿到一份"生命进度条"就能对抗死神。 然而一项基于12,000人纵向队列的最新研究,把这套叙事连根拔起。 来自人类表型计划(Human Phenotype Project)的研究团队整合了转录组、脂质组、代谢组和微生物组数据后发现:真正与全身系统性衰退关联最紧密的衰老指标,不是DNA甲基化,而是你肠道里的那群细菌。 基于微生物组的衰老时钟——注意,是那些你每天冲进马桶里的东西——在预测多病共存(multimorbidity)和16种常见非癌症疾病时,命中其中14种。即便校正了实际年龄、性别和BMI这些传统变量 …
阅读更多
Aug 31

MITRE硬件榜,AI偷走四成

MITRE的"最重要硬件弱点"榜单,是全球硬件安全圈最严肃的专家共识,每一份入选漏洞都经过数十位工程师的反复审视。但2025版的背后,藏着一个让专家们五味杂陈的事实:1026份候选漏洞里,有411份——也就是整整四成——是由一个从未见过任何标注数据的AI流水线筛出来的。这不是辅助,是接生。 MITRE最硬的榜单,悄悄换了接生婆 说起MITRE CWE的"最重要硬件弱点"(MIHW),业内的想象是:几位白发苍苍的工程师坐在会议室里,对着成吨的CVE报告逐条过审,靠数十年经验拍板哪些漏洞"足够致命"。这套流程庄严、缓慢、自带权威光环。 但2025版MIHW的实际生产链路,被一篇arXiv:2509.00647的论文撕开了一个口子。研究团队用LLM-HyPZ这套零样本框架,把2021至2024年的CVE语料跑了一遍,从浩如烟海的漏洞库里 …
阅读更多
Aug 27

学界共识:超七成学者拒绝承认大模型是智能

当科技公司用"通用人工智能"、“超级智能”、“AI觉醒"等词汇疯狂营销时,一项覆盖303位跨学科研究者的调查,用数据给这个燥热的舆论场浇了一盆冰水:我们连"什么是智能"都没有共识,凭什么说LLM已经"智能"了? 一篇最新论文(2505.20959)系统性地调研了学术界对"智能"概念的理解,以及对当前LLM系统的评价。这项研究的结论既令人意外,又在情理之中——智能的核心特征确实存在高度共识,但对LLM的"智能"属性,学术界的态度远比公众认知的更加保守和审慎。 归纳、适应、推理:三大支柱形成共识 调查首先探究了一个基础问题:研究者们认为"智能"的核心特征是什么? 结果显示,无论学科背景(计算机科学、认知科学、神经科学等)、职业阶段 …
阅读更多
Aug 18

金融基础模型的三足鼎立与融合困局

当华尔街的Quant们还在用BERT时代的微调模型做金融预测时,一场静悄悄的革命已经在金融AI领域展开——基础模型正在重写整个行业的游戏规则。但问题是:谁将最终统治这个战场? 一篇最新综述(2507.18577)系统性地梳理了金融基础模型(Financial Foundation Models, FFMs)的发展全景图,将这个新兴领域分为三大阵营:金融语言基础模型(FinLLM)、金融时序基础模型(FinTSFM)、金融视觉-语言基础模型(FinVLFM)。这场"三国演义"背后,隐藏着金融AI走向AGI的真正挑战。 从窄到广:金融AI的范式转移 传统金融AI的工作方式是"一个模型,一个任务":情感分析模型做情感分析,风险评估模型做风险评估,股票预测模型做股票预测。每个系统都是独立构建、独立部署、独立维护的"烟囱式"架构。 基础模型 …
阅读更多

© 2026 Hot Ingest