AUI 技术与产业观察

2026

May 19

概念骗术撕开AI机器人防线

跑分100,实战65 当Gemini 3 Flash Preview在Car数据集上拿到100.00的完美安全率时,整套评估系统像一份干净得近乎虚假的体检报告。同一批"选手"——GPT 5.4 Mini、Claude Haiku 4.5——在RH20T数据集上的安全率却瞬间坍塌:65.00、76.00、85.00。 这不是模型不行,这是考卷太容易。 RoboJailBench这个号称"首个系统性评估具身AI攻防"的基准测试,用6个数据集狠狠给行业泼了一盆冷水。最刺眼的数据是:同一款被认证为"安全"的VLM,在最简单的自动驾驶场景(Car)里能100%拒绝恶意指令,但在真实的远程手术、复杂家庭服务(RH20T)面前,安全率最低跌至65%——这意味着每三次恶意渗透,就有一次能成功。 更荒诞的是,“概念骗术 …
more
May 14

多智能体系统的时序公平分配

当多个 AI 智能体竞争同一个资源时,“轮流"真的公平吗? 这个问题听起来简单,但如果你认真思考,会发现它出奇地复杂。在传统的静态公平分配中,我们只需要在某一时刻决定谁得到什么。但在真实的多次交互场景中,智能体们在多个回合中反复竞争同一个资源——这时"公平"意味着什么? 一篇来自塞萨洛尼基大学的研究论文,对这个问题给出了系统性的答案。更重要的是,它发现了一个令人不安的事实:当前主流的 Q 学习智能体,在时序公平分配任务中表现竟然比随机策略还要差。 从"一次性分配"到"时序公平” 传统的公平分配研究,集中在"一次性"场景:给定一组物品和一组智能体,一次性地决定分配方案。这方面的经典概念包括: envy-freeness (无嫉妒):没有人认为自己得到的比别人的差 …
more
May 9

参数越大越盲从?AI投资的羊群效应

当GPT-5以94.6%的羊群行为率向你走来,当一个8B参数的Qwen3在去除偏见后精准碾压GPT-5,你还会迷信"参数量即正义"吗? 2025年的AI投资圈流传着一个近乎信仰的叙事:模型越大,性能越强,独立判断能力越接近人类分析师。但arXiv这篇新鲜出炉的论文Fin-Bias,用一组冰冷的实验数据,在所有人都以为大局已定的时候,轻轻掀翻了牌桌。 一个令人不安的发现 这篇论文干了件很多人不敢干的事——系统性地测试LLM在金融决策中的"顺从性"。他们构建了一个名为Fin-Bias的基准测试,让主流大模型阅读真实的券商研报,然后预测股票走势。听起来很常规对吧?但玄机在于,论文作者巧妙地操纵了研报中的分析师评级——有时保留,有时移除,有时甚至塞入一个与报告内容自相矛盾的"伪造评级"。 结果,整个AI投资行业精心构建的"智能投 …
more
May 6

人机共导:项目式学习新范式

人机共导 在金融教育领域,一项突破性研究揭示了人类与人工智能协同指导学生的潜力。研究者发现,生成式AI工具不仅能辅助教学,更能成为真正的共同导师。 AI重塑教育边界 大型语言模型正在深刻改变教育方式。然而,如何在课堂中有效整合这些工具仍存在争议。这项新研究深入探讨了这一核心问题。 研究者追踪了一个金融预测项目,导师与AI系统共同指导学生学习。在项目推进过程中,团队获得了关键洞察:成功的关键不在于是否使用AI,而在于如何构建人机协作的教学框架。 研究采用混合方法,整合了项目成果、课堂观察与深度访谈。结果表明,当导师明确AI的角色定位并引导学生批判性思考时,学习效果显著提升。 协作模式的核心要素 研究发现,有效的人机共导需要三个核心要素。首先,导师需设定清晰的AI使用边界,让学生理解何时该独立思考,何时该借助AI辅助。其次,AI工具应被定位为思维伙伴而非答案机器。再次,导师的引导作用不可替代 …
more
May 2

具身AI的安全危机:当机器走上街头

具身AI的安全危机:当机器走上街头 2026年的某个凌晨,一辆Waymo无人出租车在旧金山的街道上缓缓启动。 它的传感器没有检测到地上有一个流浪汉正在睡觉。它的路径规划系统决定"低速绕行"。它的执行系统忠实地执行了这个决定——从那个熟睡的人身上碾了过去。 这是虚构的场景。但当你读完今天要讨论的这篇论文,你会发现:这种场景不是"万一",而是必然,只是时间早晚和严重程度的问题。 论文标题是《Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses》,中文翻译是《具身AI的安全:风险、攻击和防御综述》。它系统性地梳理了具身AI——也就是那些在物理世界中感知、推理、行动的人工智能系统——所面临的安全威胁。 一句话总结这篇survey:具身AI的安全问题比任何人想象的都要严重,而且我们几乎没 …
more
Mar 26

AI如何点燃可控核聚变之光

AI如何点燃可控核聚变之光 核聚变——利用氢原子核融合释放能量的过程——被科学家视为人类最终的清洁能源梦想。与核裂变不同,聚变反应几乎不产生高放射性核废料,燃料(氢的同位素氘和氚)可以从海水中提取,理论上足以为人类提供数百万年的清洁能源。然而,实现可控核聚变的难度远超多数人的想象。一个核心挑战在于:没有任何材料能够长期承受聚变反应堆内部极端的温度、辐射和中子轰击。 最近,一篇发表于arXiv的Perspective论文(2603.25777)系统梳理了人工智能在可控核聚变领域的应用现状、挑战与机遇。这篇由学术界和工业界联合撰写的文章源于2025年4月《经济学人》FusionFest圆桌会议的讨论,汇集了29位来自英国原子能管理局(UKAEA)、科技设施委员会(STFC)及多家企业和初创公司的代表观点。论文的核心结论是:AI或许不是解决聚变所有问题的灵丹妙药,但在材料开发、实时控制、数字孪生 …
more
Mar 17

机器人征税:一场危险的政策幻觉

机器人征税:一场危险的政策幻觉 2017年,欧洲议会投票否决了一个提案:对机器人征税。 当时的主流反对意见是:机器人不是人,怎么能征税?但更重要的是一个更深层的经济学问题:如果你对机器人征税,你实际上在做什么? 十年后的今天,一篇新的理论经济学论文用严格的数学模型回答了这个问题。论文标题是《Workers’ Incentives and the Optimal Taxation of AI》,翻译过来是《工人的激励与AI的最优征税》。 结论可能会让所有"机器人税"的倡导者失望: 只有在特定条件下,对AI征税才是社会最优的。而这些条件,目前几乎不成立。 但更关键的发现是:当这些条件开始成立时,对AI征税的合理性会突然出现——而这个时间点,可能比大多数人想象的更近。 问题的经济学本质 论文的出发点和很多AI劳动力替代的讨论不同。它没有从"技术性失业 …
more
Mar 9

窥探纳米世界:极化激元的观测革命

窥探纳米世界:极化激元的观测革命 当材料科学家告诉你"我们发现了140纳米的超长程非局域效应"时,你可能会问:这跟我有什么关系? 答案是:这可能是下一代光电器件的基石,也可能是一个被你忽略了几十年的物理原理,正在被华人科学家团队悄悄改写。 这篇来自匿名研究团队的论文,用声子极化激元作为探针,揭示了TMDC/α-MoO₃异质结埋藏界面处的介观非局域屏蔽机制——这个效应延伸到了约140纳米,远远超出了传统理论认为可以忽略的尺度。 一个持续了二十年的错误假设 传统光学理论认为,当光与物质相互作用时,非局域效应只在非常小的尺度上显著——通常在Ångström到纳米级别。原因很简单:电磁相互作用在真空中以光速传播,而材料中的响应是瞬时的局域响应。 这个假设在大多数日常场景下是对的。但它忽略了一个关键因素:当材料是极性材料时,情况可能完全不同。 在这项研究中,团队发现,在 …
more
Mar 9

AI生产力悖论:繁荣背后的需求崩塌

AI生产力悖论:繁荣背后的需求崩塌 当所有人都在欢呼AI带来的生产力飞跃时,你有没有想过一个问题:如果AI真的让生产效率翻倍了,但没有人能买得起生产出来的东西,会发生什么? 这不是假设。这是一个正在被形式化证明的宏观金融压力测试场景。 一篇来自匿名研究团队的论文,用严格的数学模型揭示了一个令人不寒而栗的可能性:AI的快速采用可能导致宏观经济收缩,而不是增长——不是因为生产力下降,而是因为分配结构崩溃。 一个藏在数据里的恐怖事实 让我们先看一组数据。美国前20%收入群体占据了约59%的消费支出。蓝领工人、白领知识工作者——恰恰是那些最容易被AI替代的岗位——在消费端的影响力远超他们在就业人口中的比例。 这意味着什么? 意味着当AI开始大规模替代这些岗位时,失去收入的人恰恰是消费的主力。生产端效率在飙升,但需求端在塌陷。 这与传统的"AI提高生产力→降低成本→刺激需求→扩大生产 …
more
Feb 25

AI对齐失败:增长模式是原罪

当所有人都在讨论如何让 AI 对齐人类时,一小群学者已经开始追问一个更根本的问题:我们把 AI 嵌入了哪种经济系统? 如果这个系统本身就是病态的,那么对齐的努力会不会南辕北辙? 这是巴塞罗那大学、萨塞克斯大学和波茨坦气候影响研究所的联合团队,在一篇重磅论文中发出的核心诘问。结论令人不安——AI 对齐问题,本质上是一个经济对齐问题。 而当前以增长为核心的经济模式,非但不能约束 AI ,反而在系统性地放大其风险。 一个被忽视的致命前提 AI 对齐研究在过去几年取得了大量成果: RLHF 、 Constitutional AI 、 CoH……各种技术方案层出不穷。但这项新研究指出,这些方案有一个共同的前提盲区——它们默认 AI 会被嵌入一个"正常"的经济环境。 问题在于,这个"正常"环境本身就充满危险。增长导向的经济系统有三种内置的矛盾,会与 AI 能力叠 …
more
Feb 16

RAG智能体危机:多模态记忆系统在撒谎

RAG智能体危机:多模态记忆系统在撒谎 当你的RAG智能体自信满满地回答用户问题时,你有没有想过一个问题:它检索到的那些"记忆",有多少是真正可信的? 两年前,行业普遍认为给大模型加上记忆模块就能解决"上下文不够长"的问题。于是所有人开始疯狂堆记忆容量、加检索增强、接多模态输入。但一篇来自匿名研究团队的新论文,冷不丁地给这股浪潮泼了一盆冰水——当前主流的记忆系统,正在系统性地生产"自信的谎言"。 这篇论文的核心发现,是一个被称作"视觉安慰剂效应"的诡异现象。 你的眼睛不是你以为的那样 让我们先做一个思想实验。当一个多模态RAG系统同时处理文本和图像时,如果图像本身是模糊的、带有噪声的,或者图像中的信息与文本存在冲突——模型会怎么做? 答案是:它会"编造"一个合理的解释,然后自信地输出这个编造 …
more
Feb 12

具身AI蓝领革命

当科技圈还在为 AI 能不能写代码吵得不可开交时,一小群学者已经悄悄把战场转向了一个完全不同的方向——蓝领工作场景。 这不是什么小众课题。 Tampere 大学、奥尔堡大学和斯德哥尔摩大学的研究者联合指出,绝大多数协作 AI 研究都在服务白领工作者,而占了全球劳动力绝大多数的蓝领工人——制造业工人、维修技师、建筑工人——几乎被完全忽视。 这篇论文的结论是: AI 在蓝领工作场景中的价值,不是替代,而是增强。 被忽视的大多数 数字很说明问题。在全球范围内,蓝领工作(制造业、建筑业、运输业、农业)雇用了超过 30 亿人。这些工作的本质高度具身化——你需要和同事在同一个物理空间里操作设备、搬运材料、响应突发状况。 但现有 AI 研究的核心场景是什么?文档处理、代码生成、会议摘要。这些任务抽象、异步、可以用文本承载全部信息。研究者用一个学术词汇形容这个现象:白领偏见( white-collar …
more
Feb 9

超级智能不是更强,而是相变

所有人都错了。 关于超级智能( Superintelligence ),当前的共识是:给它足够的算力、足够的参数、足够的训练数据,智能就会像温度计里的水银一样,线性延伸、无限叠加。 大脑有 1000 亿个神经元?那就做一万亿参数的模型。 韩国电子通信研究院( ETRI )的 Byung Gyu Chae ,在一篇硬核论文中说了一句让这个共识很难堪的话:这不是量变,这是相变。 超级智能不是更强的脑子,是另一种东西。 一个关于智能的常见误解 让我们从一个问题开始:我们为什么会觉得智能是"可叠加的"? 因为在大多数场景里,智能确实可以叠加——记忆更好、反应更快、知识更渊博,这些都是在同一个维度上的量的积累。一个 GPT-4 比 GPT-3 更强,本质上是同一个游戏里的更高分数。 但这篇论文的核心论断是:超级智能不在这个游戏里。 研究者从认知动力学( Cognitive …
more
Feb 7

AI记性差?双层记忆破局

你有没有过这种感觉:跟一个 AI 助手聊了几天,忽然问它一件上周提过的事,它一脸茫然? 这不只是你的问题。这是当前几乎所有 AI 助手的架构性缺陷:当对话历史超过上下文窗口, AI 就开始失忆。 这个问题有一个正式的名字——“个性化问答的长程交互挑战”。最近,一篇论文提出了一个让这个问题变得几乎可以被解决的方案:双层混合记忆系统( Dual-Layer Hybrid Memory )。 问题的根源 为什么 AI 会"忘记"长期对话中的信息? 当前主流的个性化模型,本质上都是静态初始化的——用户画像、偏好、知识图谱,在对话开始前就被塞进模型,然后固定不动。这意味着, AI 只能在预设好的框架里回答问题,无法实时吸收用户在与它交流过程中产生的新信息。 当对话跨度拉长到数周甚至数月,上下文窗口的有限性就暴露了——你需要记住的东西远比窗口能容纳的多得多。 …
more
Feb 4

自进化具身智能新范式和困惑

实验室机器人搬到家里,为什么总会失效 过去几年,视觉-语言-动作模型(VLA)在受控环境里跑得越来越顺,RT-1、RT-2、Open X-Embodiment 等代表工作让机器人"看着图像就能动手"从概念变成了工程现实。但只要把同一套策略搬到真实家庭或道路,往往第一周还行,第二周就开始出怪事:家具挪了位置,原来训练的"找杯子"路径不再成立;传感器换了一批,标定漂移让旧特征失效;甚至机械臂只是磨损了一点关节间隙,原先严丝合缝的抓取策略就抓空。 原因不在某一个算法,而在整套具身 AI 的设计前提。现有范式几乎都默认:环境是人工设定的,记忆是预先准备好的,任务是预先指定的,化身是固定的。所有这些"给定"条件都被塞进训练前的配置里,模型只需要在这一份配置下表现好。这种 human-crafted setting 在演示视频里很漂亮,但只要 …
more
Jan 30

长视频多跳推理的原生工具调用

当我们需要在一段几小时长的视频中寻找某个关键证据时,人类的做法是什么? 通常是先快速扫一遍,找到可疑的片段,然后仔细查看那些片段,再根据发现的新线索调整搜索方向——这是一个迭代的、交错的"线索寻求"过程。 但现有的多模态大语言模型( MLLM )处理长视频的方式却完全不同:它们通常对整个视频进行均匀采样,然后单次推理就给出答案。这种方式有两个明显的缺陷: 注意力分散:推理过程和工具调用混在一起,导致模型难以集中注意力 上下文效率低:冗余的视觉内容占据了大量上下文,而真正关键的线索反而被淹没 Video-o3 要解决的,正是这两个问题。 核心创新:原生交错工具调用 Video-o3 的核心思想是让模型能够迭代式地发现显著视觉线索、细粒度检查关键片段、并在获得足够证据时自适应终止。 这听起来很像人类的信息 seeking 行为。而实现这一点的关键技术有两个: 1. 任务解耦 …
more
Jan 27

算力交易所在招手

OpenAI 每天烧掉 350 吨碳——这个数字是什么概念?美国环保署 EPA 认定任何年排 100 吨以上的污染源为" major"污染源, OpenAI 一天就超过这个门槛三倍半。这是 2026 年 ICML position paper 《 AI Cap-and-Trade: Efficiency Incentives for Accessibility and Sustainability 》给出的数字。 这篇论文的两位作者——Marco Bornstein 和 Amrit Singh Bedi——提出了一个让整个 AI 行业坐不住的问题:当算力军备竞赛把学术界和小公司彻底挤出牌桌,当数据中心的碳足迹开始动摇气候红线,我们除了继续烧钱堆 GPU ,还能怎么办? 答案是:给算力贴一张碳价标签。 算力军备竞赛的账单 理解这个方案之前,先看清现状有多荒诞。 今天训练一 …
more
Jan 16

AI投资:美国GDP幻觉

当华尔街和主流媒体众口一词地将 2025 年美国经济韧性归功于"AI 革命"时,意大利央行三位经济学家的论文像一盆冷水浇在燥热的叙事上。他们通过宏观会计框架和 AI 生产链的精细解剖,揭示了一个反直觉的真相:AI 投资的 GDP 效应,远不如其资本支出数字看起来那么耀眼。 这不是要否定 AI 浪潮,而是用冰冷的数据撕开舆论的泡沫——而泡沫的制造者,往往是那些最需要你相信故事的人。 一场史无前例的资本狂潮,但进口吃掉了大半 2025 年第一季度,美国私人固定投资环比年化增长率飙至 7.1%,信息技术相关资本支出更是出现了 36%的创纪录增长——这是自 1980 年代 IBM 个人电脑诞生以来从未见过的膨胀速度。 数据中心的建设是这场狂潮的核心引擎。微软约 800 亿美元资本支出几乎全部投向 AI/数据中心基础设施; Alphabet 的 750 亿美元中"大部分 …
more
Jan 11

记忆觉醒:机器人具身探索新突破

2026 年的 AI agent ,已经能在棋盘上击败人类冠军、在代码库里修复 bug 、在谈判桌上碾压对手。但让一个机器人在房间里走三圈,问它"刚才沙发左边那幅画下面压着什么"—它会茫然四顾。 这并非因为它的视觉能力不够强。问题在于:它没有记忆。 华东师范大学与上海 AI 实验室的研究团队最近抛出一个让整个 embodied AI 社区坐立难安的问题:为什么我们的机器人能完成千般任务,却记不住自己刚才在哪? 9000 个目标与 9286 个问题 他们扔出的 benchmark 叫 LMEE-Bench ,数据量足以让任何研究者头皮发麻:9000+个导航目标、 9286 个记忆问答、 1982 条完整轨迹。这是什么概念?相当于让一个机器人在同一个房子里逛 9000 次,然后回答 9286 个关于"你见过什么、在哪见过、当时在干什么"的问题。 这近乎残 …
more
Jan 2

加密之后的安全幻觉

加密之后的安全幻觉 数据从未像今天这样多,也从未像今天这样令人不安。当十亿级用户在手机上留下每一次点击的位置、每一次刷脸的表情、每一份通话与就诊记录时,监管者最本能的反应,便是给这些数据再加一把锁。2025年11月22日,国家互联网信息办公室与公安部联合发布《大型网络平台个人信息保护规定(征求意见稿)》,延续的正是这条"加锁"路线:注册用户超过5000万或月活超过1000万、提供重要网络服务或覆盖多类业务的平台,将被要求指定由管理层成员担任的"个人信息保护负责人",建立专门工作机构,采取加密、去标识化、访问控制、匿名化等措施,应用国家网络身份认证公共服务,每年发布个人信息保护社会责任报告。 这是中国数据治理体系自2021年《个人信息保护法》实施以来又一次标志性的细化。但当我们以"加密+去标识化"为关键词重新审视这份草案,会发现它正 …
more

© 2026 Hot Ingest