九月中旬,一个名为 Jev 的模型在 Hacker News 上发布,一天内拿到 1863 分、近五百条评论,三天之内被浏览器自动化团队完成官方集成,社区冒出多个独立复现项目。它的特别之处在于:这个模型不生成任何文本。你给它一段状态和一组问题,它只返回三类东西——一个布尔概率、一个在有限选项上的概率分布、一个带分布的分数。创始人 Diogo Almeida 说得很直白:这是"结构化数据模型,技术上不是语言模型"。官方自报的数据:输出 token 免费,输入每百万 token 只要 0.042 美元,延迟 70 到 500 毫秒,宣称比大语言模型快最多 193.6 倍、便宜 444.6 倍。社区给它找到了一批恰如其分的用途:意图分类、模型路由、语义标注、输出护栏、高频实时决策。同样迅速到来的是翻车实测:在扑克决策上与最优解吻合率只有 63%,单步迷宫都解不稳,错得最离谱的处置信度反而高达 0.86。有人尖锐指出,用约束解码加一个受限 token 就能在普通开源小模型上复现类似加速,所谓的突破可能只是一层包装。一个连字都不会写的模型,何以让整个社区兴奋又警惕?这件事值得拆开来看看。
昂贵的 if 语句
先想象一段对话。客服主管对工程师说:“用户来电了,先判断他是要退款还是要投诉。“工程师说:“好,我调用 GPT,让它生成一段 JSON,字段叫 intent。“主管问:“为什么要生成 JSON?你只想要一个分类。“工程师愣了一下:“因为……模型只会说话。”
这段对话的荒诞,正是过去三年整个 AI 应用层的隐形成本。我们把一个自回归的、逐 token 生成文本的机器,硬塞进无数根本不需要"说话"的环节:意图识别、路由分发、内容审核、表单校验、上下文压缩、游戏 NPC 的选择分支。每一次调用,模型都要煞有介事地逐字吐出 {“label”: “refund”} 这几个 token,为每一个字付费、为每一个字等待。社区在 Jev 的评论区达成了一个少见的共识:生产管线中 40% 到 70% 的大模型调用只需要一个"带概率的智能 if 语句”。如果这个数字哪怕只对一半,它揭示的就是一个容易被忽略的产业事实——生成式 AI 的繁荣里,藏着巨额的"生成税”:我们用最贵的通用机器,干着最便宜的专用活计。
Jev 的目标,就是把这笔税砍掉。它的 API 只有三种问题原语:Noul(返回 P(true))、choice(返回选项全集的概率分布)、score(返回分数与分布)。技术细节上颇为扎实:13 个问题合并进一次请求,比拆分调用便宜 11.5 倍、快 9.6 倍,官方称之为 speculative fan-out——所有问题共享同一段状态编码,一次前向传播并行出结果,没有自回归,速度优势就来源于此。数学上它保证输出绝不超出给定选项集合,所以不存在编造字段、编造 JSON 的幻觉。Browser Use 团队用它重写了网页浏览决策循环,Google Flights 一次完整搜索只要 7.1 秒;一个 Claude Code 的上下文压缩插件用它并行问"这段内容该保留吗”,一天拿下 1500 星;宝可梦对战测试里它胜过旗舰大模型,成本约是对方的 1/820。这是数量级的位移。
卡尼曼的回声:快系统迟到了三十年
Jev 的概念源头被创始人直接标注出来——丹尼尔·卡尼曼的《思考,快与慢》。大语言模型是 System 2,慢、审慎、消耗巨大、适合推理;Jev 要做 System 1,快、直觉、并行、几乎免费。卡尼曼 2011 年出版这本书时总结的认知科学共识是:人类绝大多数日常决策由快系统完成,慢系统只在必要时被唤醒,而且慢系统极其懒惰,能不启动就不启动。这个理论映射到 AI 产业上,得出一个令人深思的结论:过去三年,我们用 System 2 的成本结构,去执行了海量本该属于 System 1 的任务。
AI 之前走过类似的分岔口。上世纪八十年代,专家系统产业声势浩大——MYCIN 诊断血液感染、XCON 为 DEC 配置计算机订单,规则引擎不生成任何"文本”,只做判断与选择。1986 到 1990 年间,美国企业界对专家系统的投资估计超过十亿美元,DEC 宣称 XCON 每年节省四千万美元。然后知识获取瓶颈、维护成本爆炸、brittleness(脆弱性)问题全面爆发,整个赛道在九十年代初崩塌,史称"AI 寒冬”。事后分析,专家系统衰落的原因不是"不会说话”,而是规则无法从数据中学习,每一个判断都要人类专家手工编码。Jev 与它们在输出形态上相似——都是"只选择、不生成";根本区别在于判断的来源——RLCD(校准决策强化学习)让判断从数据里长出来,而不是从专家嘴里抄出来。Jev 是带着学习能力复活归来的专家系统。历史从不简单重复,但它押韵:一种被生成式叙事淹没三十年的思路,在算力过剩的时代重新变得经济。
经济学的透镜同样清晰。布莱恩·阿瑟在《技术的本质》里描述过一个规律:通用技术在扩散初期总会"过度通用化"——蒸汽机刚出现时,工厂用它驱动整个车间的所有机器,后来才被无数专用小电机替代。电力革命的真正红利,不是来自一台巨型发电机,而是来自电动机被小型化、专用化、嵌入到每一个具体环节。阿瑟称之为"结构性深化"。Jev 所代表的,正是大模型时代的"电动机时刻":当判断类任务从通用生成机器上剥离,交给专用的小而快的模型,整个产业的成本结构才可能迎来重构。这解释了一个反直觉的现象:为什么一个"能力更弱"的模型值得关注。因为在技术经济史上,能力的专用化拆解,比能力的通用化堆叠更能创造总福利。
拆解神话:零幻觉是个文字游戏
但对兴奋情绪需要保持清醒。Jev 的宣传中,“零幻觉"三个字最醒目,也最经不起推敲。它的实际含义是:输出在数学上被约束在给定选项集合内,不可能编造不存在的字段。这是约束解码早已实现的能力——社区里 Sean Goedecke 立刻指出,他用 Qwen2.5-1.5B 加约束解码和单个受限 token,就获得了 2 到 3 倍的加速,路线完全公开。而 Jev 的弱点在另一个方向:它可能在选项内部,以极高的置信度,选错。
扑克实测把这个弱点暴露得很彻底。以求解器为真值,在 150 个决策点上,Jev 与最优解的吻合率只有 63%。扑克里随机策略的基准并不低,63% 意味着它在相当多的关键节点上是错的。更刺眼的是置信度倒挂:手持天顺时它 16 次选择全下(正确动作是过牌),错得最离谱的处置信度 0.86,而接近正确决策的处置信度只有 0.09。这是校准失败的教科书案例。认知科学里有个对应概念——“过度自信效应”,卡尼曼与特沃斯基 1977 年的经典实验早已证明:预测者在信息最不足时反而最自信。Jev 复现了人类的这个缺陷,却没有复现人类的补救机制——慢系统的自我质疑。它没有思维链,无法说"等等,让我想想”,它的整个智能被锁死在单次前向传播的直觉里。想让它的判断变好,唯一的办法是把结论直接喂进 state——它不能从原始牌面推理,只能消费别人推理好的结果。迷宫测试更直白:连单步迷宫都解不稳,训练分布里显然缺少空间推理的痕迹。
学术界对这类"直觉判断系统"的量化评估,可以借一个看似遥远的镜像来参照——九十年代美国信用评分行业的扩张。FICO 分就是一个"不生成文本的结构化决策模型":输入特征,输出分数与排序,速度快、成本低、覆盖广。事后大量计量研究发现,这类系统在分布内表现优异,在分布外则系统性地、高置信度地犯错:少数族裔社区因为历史信贷数据稀薄,被评分系统以稳定的统计置信度拒贷,而模型对此毫无"自知之明"。Agarwal 与 Fuster 等学者在检视自动化承保的文献中反复指出:自动化评分把错误从"随机噪声"变成了"结构化偏差"——人工审核时代,错误的分布是散的;机器评分时代,错误沿着数据稀薄的群体整齐排列。Jev 官方自己也承认,其置信度校准"针对预测群体而非单个答案"——这句话的意思是:平均而言它是对的,但你手里这一个答案是不是那个倒霉的少数,它不知道,也不在乎。零幻觉的承诺保的是格式的真,不是判断的真。把"不会编造选项"偷换成"不会犯错",这是本轮宣传里最精巧的文字置换。
未走的路:分层架构与诚实的定价
历史同时提供失败教训与未被采纳的更优方案。专家系统寒冬之后,学界形成了一个共识性的替代路线——不是"规则系统对抗学习系统",而是分层:快而窄的系统处理 80% 的常规判断,慢而贵的系统处理 20% 的疑难与推理,中间用一个诚实的置信度路由机制连接。这个思路在九十年代叫"混合专家",在机器人领域叫"subsumption architecture"(布鲁克斯的分层包容架构),在今天的大模型工程里叫路由与级联。这套架构思想早已是公开知识,却被生成式狂飙的三年碾了过去——当资本按 token 计费、按模型能力讲故事时,没有谁有动力告诉客户"你七成的调用不该用大模型"。Jev 的出现之所以珍贵,不在于它发明了分层,而在于它第一次把分层做成了一门生意:用价格差(快 193 倍、便宜 444 倍)把架构正确性翻译成商业必然性。
而尚未被采纳、也最该被采纳的方案,是关于"校准的诚实"。官方建议的三条原则——用自有业务 50 到 100 个标注样本做私有评测、校准置信度、低置信请求路由人工——写得克制而专业,但这条路本不该只靠使用者的自觉。信用评分行业花了二十年,才被监管逼出可解释性要求与不利行动告知义务;自动决策系统的"置信度个体化"至今仍是学术界的开放难题。Jev 这样的系统如果要进入医疗分诊、信贷预审、内容裁决这些高风险场景,需要的不是一句"群体校准"的免责声明,而是像保险精算那样公开的误差披露:在每一个可切片的人群与任务分布上,它的 63% 是多少?扑克桌上的 63% 和客服意图分类的 97%,是同一个模型的两张面孔,不拆开看,均值就是最容易误导的数字。
不过,批判的终点应当是建设。Jev 的历史位置,可能既不是革命者也不是骗局,而是一个"诚实的中间件":它把判断从生成中解放出来,把价格打回边际成本,把幻觉约束在格式之内,同时诚实地暴露了自己不会推理的天花板——毕竟它连演示都选在了 Doom 这种每秒十次反射式决策的场景,而不是棋类游戏。它提醒整个产业:智能的市场不该只有一种商品形态。让 System 1 归 System 1,让 System 2 归 System 2,让每一笔 token 预算花在需要思考的地方——这对生成式 AI 不是倒退,而是成熟。
技术史上有一个反复出现的偶然:路线切换的时刻,往往不取决于哪个方案在智识上最优,而取决于哪个方案先被定价、先被集成、先变成基础设施。专家系统在八十年代输掉,有技术的原因,也有没等到数据和算力时代的原因;Jev 在 2026 年赢来开门红,有工程的原因,也有一个被生成税压得喘不过气的产业在等它的原因。下一次当有人向你兜售"万能模型"时,不妨想起这个连字都不会写的小东西——它什么也没说,却点出了一个产业最不愿承认的事实。