大语言模型 | AUI 技术与产业观察

大语言模型


2026

Jun 5

成群结队的虚拟实验室:一个可能彻底改变科研方式的框架

你有没有想过,如果把一群 AI 虚拟实验室扔进同一个问题里,让它们像真实科学家一样互相竞争、互相启发、互相"引用",会发生什么? 不是让一个 AI 助手帮你写论文,而是让一群 AI 实验室自己"卷"出最优解。 这篇论文的答案,可能会让你重新思考"AI 能做什么科学"这件事。 从"一个人战斗"到"一群人协作" 大型语言模型( LLM )的快速发展,已经催生了所谓的agentic virtual labs——由 LLM 智能体组成的自治小组,能够自主完成从文献扫描、提出假设、尝试解决方案、写论文到评估结果的完整研究循环。 这篇论文更进一步:把这些虚拟实验室打包成一个个"粒子",组成一个蜂群( swarm ),模拟真实科学共同体的行为。 每个粒子 = 一个完整的虚拟实验室实例。 …
阅读更多
Jun 5

AI智能体的信息聚合困境:预测市场实验揭秘

核心发现 当一群 AI 智能体在预测市场中交易,谁能最终准确预测未来?一项开创性的实验研究给出了令人失望的答案:AI 智能体在简单场景下尚可,但在复杂环境中完全失效。 这项研究首次通过受控实验验证了 AI 智能体在预测市场中的信息聚合能力。研究发现,尽管 AI 在基础市场机制中表现出一定能力,但随着信息结构和支付逻辑的复杂度提升, AI 团队完全无法有效聚合信息。这一发现颠覆了人们对"最先进 AI 无所不能"的乐观预期。 实验设计 研究团队设计了一个精巧的预测市场实验: AI 智能体在获得私人信号后进行交易,研究者通过最后一轮价格的对数误差来衡量信息聚合效果。 实验采用3×3×2×2×3×2 因子设计,系统性地变化以下因素: 信息结构复杂度:从简单的三重独立二元信号(如"公司利润是否超过 100 万")到高度复杂的多层嵌套结构 交易轮次: 3 轮、 …
阅读更多
Jun 5

AI智能体叩响金融大门:架构、应用与系统风险

2026 年, AI 领域最热的词汇已经从"大模型"悄然转向"AI 智能体"( AI Agent )。当 ChatGPT 等对话系统还在回答用户一个问题时,下一代 AI 系统已经开始自主规划、调用工具、分解任务并执行业务流程——在没有人全程监督的情况下。这种从"被动回答"到"主动行动"的跨越,正在深刻改变金融市场的运行逻辑。 一篇最新发表于 arXiv 的论文( 2603.13942 )系统探讨了 AI 智能体在金融领域的架构、应用与系统性影响。论文的核心贡献在于提出了Agentic Financial Market Model ( AFMM )——一个分析 AI 智能体如何影响市场效率、流动性和系统性风险的 conceptual framework 。研究的背景耐人寻味:论文的实证部分基于 Anthropic …
阅读更多
Jun 5

AI数据中心狂飙电力危机

当 ChatGPT 在 2022 年底点燃生成式 AI 浪潮时,很少有人意识到这场技术革命的代价之一是电力。大模型的训练和推理需要海量算力,而算力来自数据中心,数据中心依赖电网供电。短短三年后,全球数据中心的电力消耗已经逼近甚至超越了一些中等国家的全国用电量——而这还只是开始。 一篇最新发表于 arXiv 的论文( 2604.06198 )首次系统量化了 AI 数据中心扩张对区域电力系统的冲击。研究者没有采用传统的能源经济学方法,而是另辟蹊径:利用大语言模型( LLM )进行语义推断,结合混合 RAG 框架预测数据中心选址和能源需求轨迹。核心发现令人警醒:AI 数据中心的地理集中化趋势正在创造"电力压力陷阱"——在局部区域形成远超电网承载能力的用电需求,并可能倒逼化石燃料发电复苏。 研究方法: LLM+RAG 的创新耦合 传统能源研究依赖历史数据和统计模型,预测数据中心 …
阅读更多
May 9

参数越大越盲从?AI投资的羊群效应

当GPT-5以94.6%的羊群行为率向你走来,当一个8B参数的Qwen3在去除偏见后精准碾压GPT-5,你还会迷信"参数量即正义"吗? 2025年的AI投资圈流传着一个近乎信仰的叙事:模型越大,性能越强,独立判断能力越接近人类分析师。但arXiv这篇新鲜出炉的论文Fin-Bias,用一组冰冷的实验数据,在所有人都以为大局已定的时候,轻轻掀翻了牌桌。 一个令人不安的发现 这篇论文干了件很多人不敢干的事——系统性地测试LLM在金融决策中的"顺从性"。他们构建了一个名为Fin-Bias的基准测试,让主流大模型阅读真实的券商研报,然后预测股票走势。听起来很常规对吧?但玄机在于,论文作者巧妙地操纵了研报中的分析师评级——有时保留,有时移除,有时甚至塞入一个与报告内容自相矛盾的"伪造评级"。 结果,整个AI投资行业精心构建的"智能投 …
阅读更多
Feb 25

AI对齐失败:增长模式是原罪

当所有人都在讨论如何让 AI 对齐人类时,一小群学者已经开始追问一个更根本的问题:我们把 AI 嵌入了哪种经济系统? 如果这个系统本身就是病态的,那么对齐的努力会不会南辕北辙? 这是巴塞罗那大学、萨塞克斯大学和波茨坦气候影响研究所的联合团队,在一篇重磅论文中发出的核心诘问。结论令人不安——AI 对齐问题,本质上是一个经济对齐问题。 而当前以增长为核心的经济模式,非但不能约束 AI ,反而在系统性地放大其风险。 一个被忽视的致命前提 AI 对齐研究在过去几年取得了大量成果: RLHF 、 Constitutional AI 、 CoH……各种技术方案层出不穷。但这项新研究指出,这些方案有一个共同的前提盲区——它们默认 AI 会被嵌入一个"正常"的经济环境。 问题在于,这个"正常"环境本身就充满危险。增长导向的经济系统有三种内置的矛盾,会与 AI 能力叠 …
阅读更多
Jan 30

长视频多跳推理的原生工具调用

当我们需要在一段几小时长的视频中寻找某个关键证据时,人类的做法是什么? 通常是先快速扫一遍,找到可疑的片段,然后仔细查看那些片段,再根据发现的新线索调整搜索方向——这是一个迭代的、交错的"线索寻求"过程。 但现有的多模态大语言模型( MLLM )处理长视频的方式却完全不同:它们通常对整个视频进行均匀采样,然后单次推理就给出答案。这种方式有两个明显的缺陷: 注意力分散:推理过程和工具调用混在一起,导致模型难以集中注意力 上下文效率低:冗余的视觉内容占据了大量上下文,而真正关键的线索反而被淹没 Video-o3 要解决的,正是这两个问题。 核心创新:原生交错工具调用 Video-o3 的核心思想是让模型能够迭代式地发现显著视觉线索、细粒度检查关键片段、并在获得足够证据时自适应终止。 这听起来很像人类的信息 seeking 行为。而实现这一点的关键技术有两个: 1. 任务解耦 …
阅读更多
Jan 27

算力交易所在招手

OpenAI 每天烧掉 350 吨碳——这个数字是什么概念?美国环保署 EPA 认定任何年排 100 吨以上的污染源为" major"污染源, OpenAI 一天就超过这个门槛三倍半。这是 2026 年 ICML position paper 《 AI Cap-and-Trade: Efficiency Incentives for Accessibility and Sustainability 》给出的数字。 这篇论文的两位作者——Marco Bornstein 和 Amrit Singh Bedi——提出了一个让整个 AI 行业坐不住的问题:当算力军备竞赛把学术界和小公司彻底挤出牌桌,当数据中心的碳足迹开始动摇气候红线,我们除了继续烧钱堆 GPU ,还能怎么办? 答案是:给算力贴一张碳价标签。 算力军备竞赛的账单 理解这个方案之前,先看清现状有多荒诞。 今天训练一 …
阅读更多

2025

Dec 22

AI背后的人:埃及数据工人生存现状

一边是 Sam Altman 在达沃斯高谈「智能即水电」,一边是开罗的某个本科毕业生,正为了一条数据标注的微任务,把眼睛贴在屏幕上点出 0.02 美元。 arXiv:2601.06057 这项基于 600 多份问卷、 15 场焦点小组与社交群组田野的研究,把一个被宏大叙事反复遮蔽的事实,砸在了所有「 AI 革命」的脑门上:让大模型学会「理解世界」的,不是算力、不是芯片、不是天才研究员,是埃及。 先看一个最简单、也最反胃的对照:研究覆盖的 636 名埃及数据工人,月均平台收入 EGP 2,793.37 ,约合 58.76 美元,折合时薪不到 1.5 美元。这个数字与埃及现行法定最低工资 EGP 7,000 ( USD 149 )相比,只有后者的 39.9%;与该国 2025 年平均月薪 EGP 9,200 ( USD 195 )相比,只剩下 30.3%。换言之,这些人正在用低于最低工资一半的 …
阅读更多
Dec 3

别再堆参数了:AI 真正缺的是记忆

89.2%、 78.5%、 65.4%——三个数字单独拎出来算不上石破天惊。但如果告诉你,这组成绩不是来自一个更大的模型,而是一套"记忆外挂",你会不会重新掂量一下自己手里那张算力账单的分量? BLIP-2 、 GPT-3.5-Turbo 、 CLIP——这三位都是当下最被供奉的"全能选手",分别在 ScienceQA 、 LoCoMo 、 MSR-VTT 三项基准上代表了视觉问答、长对话、视频-文本对齐的最高水位。结果一个叫 MemVerse 的框架,仅靠"重组记忆"这一招,就把这三个不可一世的标杆全数按在地上: ScienceQA 上把 BLIP-2 甩开 7.1 个百分点,对话连贯性比 GPT-3.5-Turbo 高出 7.2 个点,视频-文本对齐把 CLIP 拉开了 6.7 个身位。换句话说,在"局部指标 …
阅读更多
Oct 24

AI训练数据的"定价权"暗战

GPT-4 训练一次消耗的电力,够一个美国家庭用 287 年。这是算力成本。但你知道训练数据的成本是多少吗? 买断一家数据标注公司,一年的现金流就没了。这不是边际成本,这是结构性定价权的争夺。 arXiv 在 2025 年 10 月收录的这篇论文,第一次用经济学工具系统解构了 AI 训练数据的定价机制、质量评估框架和市场结构。结论反直觉却精准:数据不是大宗商品,数据市场不是有效市场,数据定价权才是 AI 霸权的真正战场。 为什么数据不是商品? 传统经济学把数据类比为石油——开采成本高,,边际成本趋零,可替代性弱。这个比喻只对了一半。 石油你可以存起来随时用,数据不行。数据的价值高度场景化:同样一张街景照片,训练自动驾驶和训练文生图模型,价值差异可以超过100 倍。数据的"使用价值"取决于模型架构、训练目标和下游任务的契合度,而不是数据本身的"客观属性 …
阅读更多
Oct 22

AI质量管理的"信息融合"黑盒

你问 ChatGPT :"《百年孤独》的作者是谁?“它答得准确无误。你再问:“莫言获得过哪个国际奖项?“它开始一本正经地编造奖项名称。 这就是 AI 的幻觉问题。但幻觉的根源不在于模型"记错了”,而在于模型"不知道自己在什么时候记错了”。 信息融合——Information Fusion——是这篇论文提出的核心解法。 一个被忽视的关键环节 AI 模型的生产流程通常被描述为:数据收集→清洗→训练→评测→部署。但在这条流水线上,有一个环节长期被忽视——信息融合( Information Fusion ),即来自不同来源、不同模态、不同结构的数据,在进入模型之前,如何被统一表征、统一理解、统一关联。 论文的核心论点是:当前 AI 质量问题的根源,有超过 60%可以追溯到信息融合阶段的缺陷,而不是训练算法本身 …
阅读更多
Oct 15

多模态AI的"记忆黑箱"难题

你跟 AI 说:“帮我看看这张 X 光片有没有异常。“它给出了专业分析。 一周后,你说:“上周我给你看过一张 X 光片,有什么问题?“它说:“抱歉,我没有看过任何 X 光片。” 这不是 bug 。这是多模态大语言模型的原生缺陷。 现有的主流多模态模型,几乎全部采用"单次推理"架构——每一次新的输入,都是一次从零开始的推理过程。它们没有记忆,没有上下文连续性,更没有跨 session 的累积知识。 arXiv 在 2025 年 10 月发表的这篇论文,第一次系统定义了"多模态 Agent 记忆”( Agentic Memory )这一概念,并推出了一个专门用于评测多模态大语言模型记忆能力的基准——Augustus。 为什么多模态记忆是个大问题? 单模态语言模型的记忆问题已经被广泛 …
阅读更多
Aug 27

学界共识:超七成学者拒绝承认大模型是智能

当科技公司用"通用人工智能"、“超级智能”、“AI觉醒"等词汇疯狂营销时,一项覆盖303位跨学科研究者的调查,用数据给这个燥热的舆论场浇了一盆冰水:我们连"什么是智能"都没有共识,凭什么说LLM已经"智能"了? 一篇最新论文(2505.20959)系统性地调研了学术界对"智能"概念的理解,以及对当前LLM系统的评价。这项研究的结论既令人意外,又在情理之中——智能的核心特征确实存在高度共识,但对LLM的"智能"属性,学术界的态度远比公众认知的更加保守和审慎。 归纳、适应、推理:三大支柱形成共识 调查首先探究了一个基础问题:研究者们认为"智能"的核心特征是什么? 结果显示,无论学科背景(计算机科学、认知科学、神经科学等)、职业阶段 …
阅读更多
Aug 18

金融基础模型的三足鼎立与融合困局

当华尔街的Quant们还在用BERT时代的微调模型做金融预测时,一场静悄悄的革命已经在金融AI领域展开——基础模型正在重写整个行业的游戏规则。但问题是:谁将最终统治这个战场? 一篇最新综述(2507.18577)系统性地梳理了金融基础模型(Financial Foundation Models, FFMs)的发展全景图,将这个新兴领域分为三大阵营:金融语言基础模型(FinLLM)、金融时序基础模型(FinTSFM)、金融视觉-语言基础模型(FinVLFM)。这场"三国演义"背后,隐藏着金融AI走向AGI的真正挑战。 从窄到广:金融AI的范式转移 传统金融AI的工作方式是"一个模型,一个任务":情感分析模型做情感分析,风险评估模型做风险评估,股票预测模型做股票预测。每个系统都是独立构建、独立部署、独立维护的"烟囱式"架构。 基础模型 …
阅读更多
Mar 7

金融RAG的时间盲区:AI为何分不清财报年份?

想象一下,你问AI助手:“苹果公司2022年12月30日的市盈率是多少?“它却给你列出了2024年的所有财务数据,然后一本正经地回答了你的问题。这不是科幻,这是当前金融多模态RAG系统的真实水平。 当RAG(检索增强生成)技术在金融领域被吹捧为"颠覆传统投研"的神器时,一篇最新论文(2503.05185)用实证数据狠狠地揭开了这个领域最尴尬的秘密:现有的金融RAG系统,连"时间"这个最基本的金融分析维度都处理不好,更别说多模态融合了。 FinTMMBench:一个让所有RAG系统"见光死"的基准测试 这篇论文的核心贡献是构建了FinTMMBench——第一个专门评估时间感知多模态金融RAG系统的基准测试。这个benchmark的构建过程本身就充满挑战: 研究团队收集了2022年所有NASDAQ-100公司的 …
阅读更多
Mar 4

华尔街博弈论:基金经理的内卷深渊

当你以为华尔街的基金经理们还在用Markowitz的古典组合理论做投资时,一群数学家已经悄悄把他们拖进了一个更残酷的博弈场——在这里,你的回报不是绝对的,而是相对于竞争对手的。谁落后,谁就死。 一篇最新论文(2503.02722)用严格的数学证明揭示了一个令人不安的事实:在竞争激烈的基金行业,超额收益(excess return)而非绝对收益,才是决定生死的终极度量。而围绕这个度量建立的博弈模型,正在动摇传统投资理论的根基。 为什么"跑赢大盘"比"赚钱"更重要? 这是一个违反直觉但极其重要的洞察。 论文指出,在真实的基金行业,资产管理公司的真正目标不是简单的资本增值,而是相对表现——跑赢同行,超越基准指数(如沪深300、标普500)。原因很残酷: 首先,投资者用排名做决策。 基金行业有一个近乎残酷的"锦标赛效应":资金永远流向过去 …
阅读更多

2024

Dec 30

没点击的广告,反而最值钱

在腾讯广告系统里,一个预测框架上线后,ARPU(每用户平均收入)拉出 4.5% 的涨幅。撬动这个数字的核心变量,既不是更精准的点击率预估,也不是更复杂的用户画像,而是"用户没点击的那条记录"。这条看起来反直觉的路径,正在改写广告系统的预测范式。 主流预测模型,把最贵的数据扔进了垃圾堆 过去几年,广告系统的预测战场几乎被"点击率"三个字独占。工程师们比谁的 DNN 更深、谁的特征交叉更花哨、比谁能从用户历史点击里榨出多零点几个百分点的 AUC。但这场军备竞赛从一开始就埋着盲区:用户看见了广告、考虑了三秒、最终没点,这条数据在绝大多数系统里连日志的正式席位都没有。 这恰恰是工业界最荒诞的错配。真正决定一个广告系列能否跑出预算的,从来不是单次点击的概率,而是用户在持续曝光下的疲劳曲线。一条广告在用户面前出现第 1 次时点击率可能有 8%,第 3 次降到 …
阅读更多
Dec 29

跑分第一的AI,读不懂一句绝望

2024 年初发表的一篇论文测试了 11 个主流大模型在心理诊疗摘要任务上的表现。跑分冠军 MentalLlama 在自动评测中遥遥领先,但人类专家的盲审结论却是:这些模型在临床敏感维度上集体失灵,尤其对自杀风险和疗效评估几乎无能为力。 ROUGE-1 拿到 30.86 ,是胜利还是笑话 在 MentalCLOUDS 数据集( 191 场心理咨询对话)的竞技场上, MentalLlama 以 ROUGE-1 F1 值 30.86 的成绩登顶。这个数字乍看很美——比第二名高出几个点,在"症状与病史"摘要子任务上一骑绝尘。但任何盯着这一行数字超过十秒的人都会发现一个尴尬的事实: ROUGE-2 只有 5.46 , ROUGE-L 仅 19.4 。这不是"碾压式胜利",而是一场集体低分竞赛中的相对领跑,所谓"领先",不过是矮子里拔将军罢 …
阅读更多
Dec 20

模糊才是真相:3D重建的"失焦革命

3D重建领域有条不成文的铁律:输入越清晰,模型输出越精确。但2024年底一篇被arXiv收录的论文,正在系统性拆解这条铁律——它拿"拍糊"的失焦图像当训练数据,在Deblur-NeRF合成数据集的Factory场景上把LPIPS压到0.0489,比号称最懂模糊的BAGS又低了三成多;更离谱的是,它在NeRF-LLFF这种以"全清晰"著称的基准上,也反超了原生3DGS。这不是某项指标的偶然抖动,而是对"清晰即正义"这一行业信仰的正面宣战。 把"拍糊"塞进3D高斯球 传统3D Gaussian Splatting自2023年横空出世以来,靠"先把世界撒成一亿个发光小雪球、再用光栅化一帧帧画出来"的暴力美学,在实时性与画质之间撕开一道口子。但它的硬伤同样刺眼:默认输入是"理想针孔相机 …
阅读更多

© 2026 Hot Ingest