大模型 | AUI 技术与产业观察

大模型


2026

Sep 22

不会聊天的大模型 Jev,为何登顶

九月中旬,一个名为 Jev 的模型在 Hacker News 上发布,一天内拿到 1863 分、近五百条评论,三天之内被浏览器自动化团队完成官方集成,社区冒出多个独立复现项目。它的特别之处在于:这个模型不生成任何文本。你给它一段状态和一组问题,它只返回三类东西——一个布尔概率、一个在有限选项上的概率分布、一个带分布的分数。创始人 Diogo Almeida 说得很直白:这是"结构化数据模型,技术上不是语言模型"。官方自报的数据:输出 token 免费,输入每百万 token 只要 0.042 美元,延迟 70 到 500 毫秒,宣称比大语言模型快最多 193.6 倍、便宜 444.6 倍。社区给它找到了一批恰如其分的用途:意图分类、模型路由、语义标注、输出护栏、高频实时决策。同样迅速到来的是翻车实测:在扑克决策上与最优解吻合率只有 63%,单步迷宫都解不稳,错得最离谱的 …
阅读更多
Jun 5

成群结队的虚拟实验室:一个可能彻底改变科研方式的框架

你有没有想过,如果把一群 AI 虚拟实验室扔进同一个问题里,让它们像真实科学家一样互相竞争、互相启发、互相"引用",会发生什么? 不是让一个 AI 助手帮你写论文,而是让一群 AI 实验室自己"卷"出最优解。 这篇论文的答案,可能会让你重新思考"AI 能做什么科学"这件事。 从"一个人战斗"到"一群人协作" 大型语言模型( LLM )的快速发展,已经催生了所谓的agentic virtual labs——由 LLM 智能体组成的自治小组,能够自主完成从文献扫描、提出假设、尝试解决方案、写论文到评估结果的完整研究循环。 这篇论文更进一步:把这些虚拟实验室打包成一个个"粒子",组成一个蜂群( swarm ),模拟真实科学共同体的行为。 每个粒子 = 一个完整的虚拟实验室实例。 …
阅读更多
Jun 5

AI智能体叩响金融大门:架构、应用与系统风险

2026 年, AI 领域最热的词汇已经从"大模型"悄然转向"AI 智能体"( AI Agent )。当 ChatGPT 等对话系统还在回答用户一个问题时,下一代 AI 系统已经开始自主规划、调用工具、分解任务并执行业务流程——在没有人全程监督的情况下。这种从"被动回答"到"主动行动"的跨越,正在深刻改变金融市场的运行逻辑。 一篇最新发表于 arXiv 的论文( 2603.13942 )系统探讨了 AI 智能体在金融领域的架构、应用与系统性影响。论文的核心贡献在于提出了Agentic Financial Market Model ( AFMM )——一个分析 AI 智能体如何影响市场效率、流动性和系统性风险的 conceptual framework 。研究的背景耐人寻味:论文的实证部分基于 Anthropic …
阅读更多
Jun 5

AI数据中心狂飙电力危机

当 ChatGPT 在 2022 年底点燃生成式 AI 浪潮时,很少有人意识到这场技术革命的代价之一是电力。大模型的训练和推理需要海量算力,而算力来自数据中心,数据中心依赖电网供电。短短三年后,全球数据中心的电力消耗已经逼近甚至超越了一些中等国家的全国用电量——而这还只是开始。 一篇最新发表于 arXiv 的论文( 2604.06198 )首次系统量化了 AI 数据中心扩张对区域电力系统的冲击。研究者没有采用传统的能源经济学方法,而是另辟蹊径:利用大语言模型( LLM )进行语义推断,结合混合 RAG 框架预测数据中心选址和能源需求轨迹。核心发现令人警醒:AI 数据中心的地理集中化趋势正在创造"电力压力陷阱"——在局部区域形成远超电网承载能力的用电需求,并可能倒逼化石燃料发电复苏。 研究方法: LLM+RAG 的创新耦合 传统能源研究依赖历史数据和统计模型,预测数据中心 …
阅读更多
May 9

参数越大越盲从?AI投资的羊群效应

当GPT-5以94.6%的羊群行为率向你走来,当一个8B参数的Qwen3在去除偏见后精准碾压GPT-5,你还会迷信"参数量即正义"吗? 2025年的AI投资圈流传着一个近乎信仰的叙事:模型越大,性能越强,独立判断能力越接近人类分析师。但arXiv这篇新鲜出炉的论文Fin-Bias,用一组冰冷的实验数据,在所有人都以为大局已定的时候,轻轻掀翻了牌桌。 一个令人不安的发现 这篇论文干了件很多人不敢干的事——系统性地测试LLM在金融决策中的"顺从性"。他们构建了一个名为Fin-Bias的基准测试,让主流大模型阅读真实的券商研报,然后预测股票走势。听起来很常规对吧?但玄机在于,论文作者巧妙地操纵了研报中的分析师评级——有时保留,有时移除,有时甚至塞入一个与报告内容自相矛盾的"伪造评级"。 结果,整个AI投资行业精心构建的"智能投 …
阅读更多
Feb 16

RAG智能体危机:多模态记忆系统在撒谎

RAG智能体危机:多模态记忆系统在撒谎 当你的RAG智能体自信满满地回答用户问题时,你有没有想过一个问题:它检索到的那些"记忆",有多少是真正可信的? 两年前,行业普遍认为给大模型加上记忆模块就能解决"上下文不够长"的问题。于是所有人开始疯狂堆记忆容量、加检索增强、接多模态输入。但一篇来自匿名研究团队的新论文,冷不丁地给这股浪潮泼了一盆冰水——当前主流的记忆系统,正在系统性地生产"自信的谎言"。 这篇论文的核心发现,是一个被称作"视觉安慰剂效应"的诡异现象。 你的眼睛不是你以为的那样 让我们先做一个思想实验。当一个多模态RAG系统同时处理文本和图像时,如果图像本身是模糊的、带有噪声的,或者图像中的信息与文本存在冲突——模型会怎么做? 答案是:它会"编造"一个合理的解释,然后自信地输出这个编造 …
阅读更多

© 2026 Hot Ingest