Scholars | AUI 技术与产业观察

Scholars


2026

Aug 14

被数字困住的大模型:数值接地框架与算术硬伤

大语言模型可以解决复杂的数学竞赛题,却经常在最基础的小学算术上出错。 判定 9.11 大于 9.9 并不是个案。在面对多位数加法、小数乘法以及科学计数法转换时,主流模型同样容易得出错误答案。这种基础数值处理能力的漏洞,在 GPT、Claude 和 Gemini 等前沿模型中普遍存在。这反映出大模型在处理数字时,依然将其作为普通的语义符号进行统计关联,而非将其作为数学数值进行物理量化。 最新论文《大语言模型的数值计算能力:根本局限性与改进路径》(arXiv: 2608.13129)指出,大模型的基本数值处理能力与高阶数学推理是完全独立的维度。模型算术漏洞的根源在于数值接地的失效。 基础数值敏感度与高阶推理的脱钩 很多开发者认为,只要大模型能够看懂高等代数,做加减乘除自然不在话下。为了提升算术能力,常规做法是往训练集中灌入更多数学课本,或者通过思维链拉长模型的推理步骤。 然而,这种做法混淆了推 …
阅读更多
Aug 14

自我进化:如何打破 Agent 技能的饱和极限

在 LLM 驱动的 Agent 开发与维护实践中,业界正面临一个公开的秘密:Agent 的自我进化存在物理天花板。 不管是使用经典的 Self-Refine(自我反思)还是 Single-turn QA(单轮问答反馈),Agent 的技能提升曲线往往在第一轮修改后就迅速饱和。即使继续注入测试用例,让大模型反复反思,其任务解决率也无法继续爬升。相反,频繁的修改还会导致技能文档出现"自我吞噬",即前一轮刚修好的 Bug,在下一轮修改其他功能时又重新暴露。 近日,一篇名为《基于多轮交互反馈的自更新进化梯度》的论文,为打破这一瓶颈提供了工程层面的新视角。该研究指出,Agent 技能无法持续演化的根源在于反馈梯度的枯竭与文本知识库的结构性退化。通过引入多轮交互反馈与主动诊断治理,SkillEvo 成功在云服务等高复杂度业务场景中,将 Agent 任务解决率从初始的 30.0% 拉 …
阅读更多
Jun 14

AI 投研边界:金融深度研究的现实差距

市面上的深度研究(Deep Research)Agent 已经能写出排版规整、动辄数十页的行业分析与尽职调查报告。如果只看行文结构与专业术语堆砌,这些文本看起来和券商研报十分相似。 但如果让买方机构或华尔街的行研分析师(Equity Research)来审阅,这些报告在核心逻辑上往往站不住脚。 最新论文《评估AI开展专业金融投资研究的能力》(arXiv: 2604.21006)构建了一套面向专业投资研究的评估基准,对 OpenAI、Gemini、Perplexity 和 Grok 等主流深度研究 Agent 进行了系统评测。测试结果表明,在财务预测精度、估值逻辑深度和数据可验证性这三个关键维度上,AI 生成的研报与人类专业分析师之间依然存在明显差距。 定性推演与量化预测的实际表现 一份投资研究报告的价值,主要取决于财务建模是否扎实以及估值推导是否有事实依据。如果对核心财务指标的预测出现偏差 …
阅读更多
Jun 13

微机器人:正在学会思考

你可能想象不到,一粒尘埃大小的机器人,正在学会"思考"。 这并非科幻。 2025 年 10 月发表于 arXiv 的这篇论文,系统梳理了微机器人领域从生物模仿( Biomimetics )向智能系统( Intelligent Systems )跃迁的技术路线图。结论很明确:下一阶段微机器人的核心竞争力,不再是"像什么生物",而是"能不能自己决策"。 从"复刻器官"到"装上大脑" 过去二十年,微机器人的主流范式是结构复刻——抄蜻蜓的翅膀、抄水黾的脚、抄鞭毛虫的尾巴。做出一个微观结构,声称"仿生"。但这类机器本质上是一个有形状的机械零件,靠外部磁场或光照驱动,没有任何自主感知能力。 真正的转折发生在具身智能( Embodied Intelligence )概念的引入。具身智能 …
阅读更多
Jun 5

成群结队的虚拟实验室:一个可能彻底改变科研方式的框架

你有没有想过,如果把一群 AI 虚拟实验室扔进同一个问题里,让它们像真实科学家一样互相竞争、互相启发、互相"引用",会发生什么? 不是让一个 AI 助手帮你写论文,而是让一群 AI 实验室自己"卷"出最优解。 这篇论文的答案,可能会让你重新思考"AI 能做什么科学"这件事。 从"一个人战斗"到"一群人协作" 大型语言模型( LLM )的快速发展,已经催生了所谓的agentic virtual labs——由 LLM 智能体组成的自治小组,能够自主完成从文献扫描、提出假设、尝试解决方案、写论文到评估结果的完整研究循环。 这篇论文更进一步:把这些虚拟实验室打包成一个个"粒子",组成一个蜂群( swarm ),模拟真实科学共同体的行为。 每个粒子 = 一个完整的虚拟实验室实例。 …
阅读更多
Jun 5

AI智能体的信息聚合困境:预测市场实验揭秘

核心发现 当一群 AI 智能体在预测市场中交易,谁能最终准确预测未来?一项开创性的实验研究给出了令人失望的答案:AI 智能体在简单场景下尚可,但在复杂环境中完全失效。 这项研究首次通过受控实验验证了 AI 智能体在预测市场中的信息聚合能力。研究发现,尽管 AI 在基础市场机制中表现出一定能力,但随着信息结构和支付逻辑的复杂度提升, AI 团队完全无法有效聚合信息。这一发现颠覆了人们对"最先进 AI 无所不能"的乐观预期。 实验设计 研究团队设计了一个精巧的预测市场实验: AI 智能体在获得私人信号后进行交易,研究者通过最后一轮价格的对数误差来衡量信息聚合效果。 实验采用3×3×2×2×3×2 因子设计,系统性地变化以下因素: 信息结构复杂度:从简单的三重独立二元信号(如"公司利润是否超过 100 万")到高度复杂的多层嵌套结构 交易轮次: 3 轮、 …
阅读更多
Jun 5

AI智能体叩响金融大门:架构、应用与系统风险

2026 年, AI 领域最热的词汇已经从"大模型"悄然转向"AI 智能体"( AI Agent )。当 ChatGPT 等对话系统还在回答用户一个问题时,下一代 AI 系统已经开始自主规划、调用工具、分解任务并执行业务流程——在没有人全程监督的情况下。这种从"被动回答"到"主动行动"的跨越,正在深刻改变金融市场的运行逻辑。 一篇最新发表于 arXiv 的论文( 2603.13942 )系统探讨了 AI 智能体在金融领域的架构、应用与系统性影响。论文的核心贡献在于提出了Agentic Financial Market Model ( AFMM )——一个分析 AI 智能体如何影响市场效率、流动性和系统性风险的 conceptual framework 。研究的背景耐人寻味:论文的实证部分基于 Anthropic …
阅读更多
Jun 5

AI时代的数学与数学与人类思维:哲学视角的反思

核心观点 当 AI 开始涉足数学证明和研究,人类数学家的价值在哪里?陶哲轩等人的最新论文给出了一个深思熟虑的答案:AI 不是中性的技术进化,而是人类认知的自然延伸,其发展必须始终以人为中心。 这篇论文从哲学高度审视 AI 对数学这一"最客观、可验证的学科"的深刻影响,进而延伸到对整个人类社会的启示。作者强调, AI 工具——尤其是生成式 AI——正在威胁人类思维、创造力和伦理推理的完整性。因此,必须在 AI 快速部署的"Faustian bargain"与维护人类认知独特价值之间找到平衡。 历史镜像:这次真的不同吗? 论文首先考察了历史上自动化技术对人类工作的冲击,试图回答一个根本问题:AI 时代是否与以往的自动化浪潮有本质区别? 作者认为,区别确实存在且根本性:过去的自动化主要替代的是体力劳动和重复性认知任务,而现代 AI 开始威胁创造性知识和智力 …
阅读更多
Jun 5

AI数据中心狂飙电力危机

当 ChatGPT 在 2022 年底点燃生成式 AI 浪潮时,很少有人意识到这场技术革命的代价之一是电力。大模型的训练和推理需要海量算力,而算力来自数据中心,数据中心依赖电网供电。短短三年后,全球数据中心的电力消耗已经逼近甚至超越了一些中等国家的全国用电量——而这还只是开始。 一篇最新发表于 arXiv 的论文( 2604.06198 )首次系统量化了 AI 数据中心扩张对区域电力系统的冲击。研究者没有采用传统的能源经济学方法,而是另辟蹊径:利用大语言模型( LLM )进行语义推断,结合混合 RAG 框架预测数据中心选址和能源需求轨迹。核心发现令人警醒:AI 数据中心的地理集中化趋势正在创造"电力压力陷阱"——在局部区域形成远超电网承载能力的用电需求,并可能倒逼化石燃料发电复苏。 研究方法: LLM+RAG 的创新耦合 传统能源研究依赖历史数据和统计模型,预测数据中心 …
阅读更多
May 27

AI的思维树,算法课的入门题

当LLM社区为"思维树"(Tree of Thoughts, ToT)摇旗呐喊,声称这是大模型"类人推理"的里程碑时,一篇来自arXiv的论文冷冷地揭开了底牌:你们花了三年时间、堆了无数GPU、烧了亿万美元重新发明的东西,是计算机专业大一学生第一学期算法课第一章的课后习题。 这篇题为《Tree of Thoughts as a Classical Heuristic Search Problem》的研究,用近乎残忍的学术严谨性,将LLM社区引以为傲的每一个"创新组件"逐一拆解,对应到经典启发式搜索的理论框架中——然后得出了一个让整个NLP圈尴尬到脚趾抠地的结论:ToT不是一项新技术,它是经典搜索算法在语言模型上的降维寄生。 算法考古:一场精心包装的复古运动 让我们来做一次算法考古。 LLM社区花了几年时间,把ToT包装成 …
阅读更多
May 25

AI越精,ESG越假

翻开任何一份ESG评级报告,你都会看到一份充满数字、图表和"客观打分"的精致文档。MSCI给特斯拉打了A级,Sustainalytics却把它列为"中等风险";同一家石油巨头,在不同评级机构眼里可以同时是"行业领袖"和"争议典型"。ESG评级之间的相关系数低至0.54——比信用评级还混乱。这就是我们要用人工智能去"系统性提升"的东西。 最近arXiv上一篇综述统计了398篇相关论文,得出了一个令人哭笑不得的结论:机器学习、自然语言处理、优化算法这三大AI范式正在以前所未有的热情,试图从这堆自相矛盾的数据里"挖掘"出可持续投资的圣杯。但综述本身也承认,这个领域"still in a dynamic developmental stage with …
阅读更多
May 19

概念骗术撕开AI机器人防线

跑分100,实战65 当Gemini 3 Flash Preview在Car数据集上拿到100.00的完美安全率时,整套评估系统像一份干净得近乎虚假的体检报告。同一批"选手"——GPT 5.4 Mini、Claude Haiku 4.5——在RH20T数据集上的安全率却瞬间坍塌:65.00、76.00、85.00。 这不是模型不行,这是考卷太容易。 RoboJailBench这个号称"首个系统性评估具身AI攻防"的基准测试,用6个数据集狠狠给行业泼了一盆冷水。最刺眼的数据是:同一款被认证为"安全"的VLM,在最简单的自动驾驶场景(Car)里能100%拒绝恶意指令,但在真实的远程手术、复杂家庭服务(RH20T)面前,安全率最低跌至65%——这意味着每三次恶意渗透,就有一次能成功。 更荒诞的是,“概念骗术 …
阅读更多
May 14

多智能体系统的时序公平分配

当多个 AI 智能体竞争同一个资源时,“轮流"真的公平吗? 这个问题听起来简单,但如果你认真思考,会发现它出奇地复杂。在传统的静态公平分配中,我们只需要在某一时刻决定谁得到什么。但在真实的多次交互场景中,智能体们在多个回合中反复竞争同一个资源——这时"公平"意味着什么? 一篇来自塞萨洛尼基大学的研究论文,对这个问题给出了系统性的答案。更重要的是,它发现了一个令人不安的事实:当前主流的 Q 学习智能体,在时序公平分配任务中表现竟然比随机策略还要差。 从"一次性分配"到"时序公平” 传统的公平分配研究,集中在"一次性"场景:给定一组物品和一组智能体,一次性地决定分配方案。这方面的经典概念包括: envy-freeness (无嫉妒):没有人认为自己得到的比别人的差 …
阅读更多
May 9

参数越大越盲从?AI投资的羊群效应

当GPT-5以94.6%的羊群行为率向你走来,当一个8B参数的Qwen3在去除偏见后精准碾压GPT-5,你还会迷信"参数量即正义"吗? 2025年的AI投资圈流传着一个近乎信仰的叙事:模型越大,性能越强,独立判断能力越接近人类分析师。但arXiv这篇新鲜出炉的论文Fin-Bias,用一组冰冷的实验数据,在所有人都以为大局已定的时候,轻轻掀翻了牌桌。 一个令人不安的发现 这篇论文干了件很多人不敢干的事——系统性地测试LLM在金融决策中的"顺从性"。他们构建了一个名为Fin-Bias的基准测试,让主流大模型阅读真实的券商研报,然后预测股票走势。听起来很常规对吧?但玄机在于,论文作者巧妙地操纵了研报中的分析师评级——有时保留,有时移除,有时甚至塞入一个与报告内容自相矛盾的"伪造评级"。 结果,整个AI投资行业精心构建的"智能投 …
阅读更多
May 6

人机共导:项目式学习新范式

人机共导 在金融教育领域,一项突破性研究揭示了人类与人工智能协同指导学生的潜力。研究者发现,生成式AI工具不仅能辅助教学,更能成为真正的共同导师。 AI重塑教育边界 大型语言模型正在深刻改变教育方式。然而,如何在课堂中有效整合这些工具仍存在争议。这项新研究深入探讨了这一核心问题。 研究者追踪了一个金融预测项目,导师与AI系统共同指导学生学习。在项目推进过程中,团队获得了关键洞察:成功的关键不在于是否使用AI,而在于如何构建人机协作的教学框架。 研究采用混合方法,整合了项目成果、课堂观察与深度访谈。结果表明,当导师明确AI的角色定位并引导学生批判性思考时,学习效果显著提升。 协作模式的核心要素 研究发现,有效的人机共导需要三个核心要素。首先,导师需设定清晰的AI使用边界,让学生理解何时该独立思考,何时该借助AI辅助。其次,AI工具应被定位为思维伙伴而非答案机器。再次,导师的引导作用不可替代 …
阅读更多
May 2

具身AI的安全危机:当机器走上街头

具身AI的安全危机:当机器走上街头 2026年的某个凌晨,一辆Waymo无人出租车在旧金山的街道上缓缓启动。 它的传感器没有检测到地上有一个流浪汉正在睡觉。它的路径规划系统决定"低速绕行"。它的执行系统忠实地执行了这个决定——从那个熟睡的人身上碾了过去。 这是虚构的场景。但当你读完今天要讨论的这篇论文,你会发现:这种场景不是"万一",而是必然,只是时间早晚和严重程度的问题。 论文标题是《Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses》,中文翻译是《具身AI的安全:风险、攻击和防御综述》。它系统性地梳理了具身AI——也就是那些在物理世界中感知、推理、行动的人工智能系统——所面临的安全威胁。 一句话总结这篇survey:具身AI的安全问题比任何人想象的都要严重,而且我们几乎没 …
阅读更多
Mar 26

AI如何点燃可控核聚变之光

AI如何点燃可控核聚变之光 核聚变——利用氢原子核融合释放能量的过程——被科学家视为人类最终的清洁能源梦想。与核裂变不同,聚变反应几乎不产生高放射性核废料,燃料(氢的同位素氘和氚)可以从海水中提取,理论上足以为人类提供数百万年的清洁能源。然而,实现可控核聚变的难度远超多数人的想象。一个核心挑战在于:没有任何材料能够长期承受聚变反应堆内部极端的温度、辐射和中子轰击。 最近,一篇发表于arXiv的Perspective论文(2603.25777)系统梳理了人工智能在可控核聚变领域的应用现状、挑战与机遇。这篇由学术界和工业界联合撰写的文章源于2025年4月《经济学人》FusionFest圆桌会议的讨论,汇集了29位来自英国原子能管理局(UKAEA)、科技设施委员会(STFC)及多家企业和初创公司的代表观点。论文的核心结论是:AI或许不是解决聚变所有问题的灵丹妙药,但在材料开发、实时控制、数字孪生 …
阅读更多
Mar 17

机器人征税:一场危险的政策幻觉

机器人征税:一场危险的政策幻觉 2017年,欧洲议会投票否决了一个提案:对机器人征税。 当时的主流反对意见是:机器人不是人,怎么能征税?但更重要的是一个更深层的经济学问题:如果你对机器人征税,你实际上在做什么? 十年后的今天,一篇新的理论经济学论文用严格的数学模型回答了这个问题。论文标题是《Workers’ Incentives and the Optimal Taxation of AI》,翻译过来是《工人的激励与AI的最优征税》。 结论可能会让所有"机器人税"的倡导者失望: 只有在特定条件下,对AI征税才是社会最优的。而这些条件,目前几乎不成立。 但更关键的发现是:当这些条件开始成立时,对AI征税的合理性会突然出现——而这个时间点,可能比大多数人想象的更近。 问题的经济学本质 论文的出发点和很多AI劳动力替代的讨论不同。它没有从"技术性失业 …
阅读更多
Mar 9

窥探纳米世界:极化激元的观测革命

窥探纳米世界:极化激元的观测革命 当材料科学家告诉你"我们发现了140纳米的超长程非局域效应"时,你可能会问:这跟我有什么关系? 答案是:这可能是下一代光电器件的基石,也可能是一个被你忽略了几十年的物理原理,正在被华人科学家团队悄悄改写。 这篇来自匿名研究团队的论文,用声子极化激元作为探针,揭示了TMDC/α-MoO₃异质结埋藏界面处的介观非局域屏蔽机制——这个效应延伸到了约140纳米,远远超出了传统理论认为可以忽略的尺度。 一个持续了二十年的错误假设 传统光学理论认为,当光与物质相互作用时,非局域效应只在非常小的尺度上显著——通常在Ångström到纳米级别。原因很简单:电磁相互作用在真空中以光速传播,而材料中的响应是瞬时的局域响应。 这个假设在大多数日常场景下是对的。但它忽略了一个关键因素:当材料是极性材料时,情况可能完全不同。 在这项研究中,团队发现,在 …
阅读更多
Mar 9

AI生产力悖论:繁荣背后的需求崩塌

AI生产力悖论:繁荣背后的需求崩塌 当所有人都在欢呼AI带来的生产力飞跃时,你有没有想过一个问题:如果AI真的让生产效率翻倍了,但没有人能买得起生产出来的东西,会发生什么? 这不是假设。这是一个正在被形式化证明的宏观金融压力测试场景。 一篇来自匿名研究团队的论文,用严格的数学模型揭示了一个令人不寒而栗的可能性:AI的快速采用可能导致宏观经济收缩,而不是增长——不是因为生产力下降,而是因为分配结构崩溃。 一个藏在数据里的恐怖事实 让我们先看一组数据。美国前20%收入群体占据了约59%的消费支出。蓝领工人、白领知识工作者——恰恰是那些最容易被AI替代的岗位——在消费端的影响力远超他们在就业人口中的比例。 这意味着什么? 意味着当AI开始大规模替代这些岗位时,失去收入的人恰恰是消费的主力。生产端效率在飙升,但需求端在塌陷。 这与传统的"AI提高生产力→降低成本→刺激需求→扩大生产 …
阅读更多

© 2026 Hot Ingest