大语言模型可以解决复杂的数学竞赛题,却经常在最基础的小学算术上出错。
判定 9.11 大于 9.9 并不是个案。在面对多位数加法、小数乘法以及科学计数法转换时,主流模型同样容易得出错误答案。这种基础数值处理能力的漏洞,在 GPT、Claude 和 Gemini 等前沿模型中普遍存在。这反映出大模型在处理数字时,依然将其作为普通的语义符号进行统计关联,而非将其作为数学数值进行物理量化。
最新论文《大语言模型的数值计算能力:根本局限性与改进路径》(arXiv: 2608.13129)指出,大模型的基本数值处理能力与高阶数学推理是完全独立的维度。模型算术漏洞的根源在于数值接地的失效。
基础数值敏感度与高阶推理的脱钩
很多开发者认为,只要大模型能够看懂高等代数,做加减乘除自然不在话下。为了提升算术能力,常规做法是往训练集中灌入更多数学课本,或者通过思维链拉长模型的推理步骤。
然而,这种做法混淆了推理和计算。知道如何一步步推导公式,不代表模型理解了数字本身的物理量级含义。
当大模型把数字当成普通的语义符号进行概率拼接,而非作为数学数值进行物理量化时,任何涉及金融量化、时序分析或科学探索的 Agent 都会面临稳定性挑战。大模型在处理文本时,本质上是通过计算单词和数字出现的概率分布来生成后续内容的。当模型无法可靠地识别数字的基本属性,即使逻辑链条正确,也会因为中间计算结果的幻觉而导致答案出错。
在真实的业务场景中,这种脱钩往往会带来严重的后果。例如,一个用于自动读取财报并进行风险评估的 Agent,即使逻辑演绎无误,一旦在个位和十位数字的量级感知上出现混淆,就可能将巨大的亏损误判为盈利,或者将数百万的金额差异解释为微小的舍入误差。这就解释了为什么业界在将 Agent 引入核心生产流程时,依然对其数值输出保持高度警惕。
数值接地框架 NGF 的分层体系
为了系统地分析这一现象,论文提出了数值接地框架(Numerical Grounding Framework, NGF)。该框架将大模型的数值处理能力拆分为表征接地与过程接地两个维度。
Figure 1: 数值接地框架(NGF)类图。RG 对应数据解析与量级感知,根源在于分词层;PG 对应算术步骤的算法执行,受限于位置编码与推理开销。
表征接地 (Representational Grounding, RG)
表征接地指大模型将数字的符号形式映射为其内部的值、大小、精度与格式的能力。这包括三个关键方面:
- 量级感知:正确识别 100 大于 10,以及 9.9 大于 9.11,这是对数字空间分布的基本感知;
- 格式等价性:将分数 1/2、小数 0.5 与百分比 50% 映射为特征空间中距离相近的嵌入向量,理解不同数学符号指向相同的实际含义;
- 数位映射:准确识别多位数中每个数字对应的位值,即个位、十位、百位等空间排列关系。
过程接地 (Procedural Grounding, PG)
过程接地指大模型执行算法步骤的能力,例如大数相加时的进位传播、多位数乘法的逐位运算。即使模型能完美识别每个数字的大小(具备高水平的 RG),如果在执行计算步骤时发生状态丢失或混淆,计算依然会报错。
在人类认知科学中,这两种能力同样是解耦的。一部分脑部受损的患者依然能够对大数字的大小进行直观判断,却失去了执行竖式计算的能力。大模型在当前的架构下,同样表现出了这两种能力的经验性分离。
表现的经验性分离
在 Number Cookbook 与 NumericBench 等基准测试中,所有主流模型的表征接地表现均优于过程接地。在域内数据下,两者的表现差距平均为 0.19;而在域外长数字测试中,这一差距扩大到 0.27。
这表明,建立基础的符号映射相对容易,但在多位数算法执行上,大模型的注意力机制和记忆结构非常脆弱。随着数字位数的增加,执行长距离进位计算所需要的状态转换和中间结果存储,会迅速超过大模型上下文检索的极限。
推理预算与大模型算力代偿
通过拉长模型的思考时间,能否弥补过程接地的短板?
针对 Gemini 3 模型的对比测试给出了量化数据:
- 极小思考模式:在面对域外长数值计算时,模型直接给出答案,准确率仅为 63.4%,每次请求平均消耗 293 个 tokens;
- 深度思考模式:开启长思维链后,模型在内存中模拟草稿纸步骤,将域外准确率提升至 85.0%,但每次请求消耗的 tokens 暴增至 6,247 个,开销增加 21.3 倍。
这一数据印证了框架的预测:推理时脚手架虽然能为大模型提供临时工作内存来辅助进位,进而提升过程接地性能,但无法改变模型底层对数字字符的破损表征。
用翻了 20 多倍的算力开销来换取基本的算术正确,在实际生产环境中很难推行。大模型用思维链来充当草稿纸,虽然可以在逻辑上模拟竖式计算的进位和数位对齐,但这种用高能耗的推理计算来做确定性算术的做法,在工程部署上是非常低效的选择。
算术硬伤的根源:BPE Tokenization 与嵌入几何
大模型无法正确做算术,有两个底层的结构性原因:BPE 分词器故障与位置编码的单调性缺失。
Figure 2: BPE 贪婪分词与单字符对齐分词的对比。BPE 在面对不同数字时将其切碎为长度不一的块,破坏了十进制算术所依赖的位值对齐。
BPE 分词器破坏数位对齐
主流大模型普遍使用字节对编码(BPE)算法进行切词。BPE 完全以自然语言的词频为导向,采用贪婪合并策略。这在处理文本时效率极高,但在面对数字时却切碎了位值结构。
如上图所示,当输入数字“384”时,BPE 可能会将其分词为 ["38", "4"];而输入“3845”时,分词结果则变成了 ["3", "84", "5"]。
这种不稳定的切分方式导致了严重后果:
- 位值对齐失效:在十进制计算中,加减法高度依赖数位的空间对齐。BPE 将数字切成长度不等的 Token,使得模型的注意力机制在计算时根本找不到个位和十位的对应关系。这就像把一张写满错乱网格的草稿纸交给了计算者,强行让其进行竖式计算。
- 高位数值被掩盖:数字
84和3属于不同的 Token,模型在特征空间中无法直观辨识哪一个是更高位的数字。
位置编码与几何单调性的缺失
Transformer 架构中的位置编码(如 RoPE)用于标识顺序关系。但对于数字序列而言,不仅需要顺序,更需要数学上的单调性(即量级随着字符位移呈指数级改变)。
在目前的向量嵌入几何中,数字 Token 的分布往往缺乏规律。大模型无法在潜空间中识别邻近关系,也无法直观感知“10000”与“10”之间的数量级差异。当绝对和相对位置编码无法在数学层面上维持量级的指数递增时,模型对于超长数字的大数计算就会在特征空间中迅速迷失方向。
缓解策略与大模型的进化路径
为了提升大模型的计算能力,行业尝试了多种改进方案:
架构级修改的局限
诸如引入 Little-Endian 低位在先微调、或使用 Abacus Embeddings 算盘嵌入强制对齐位置等架构改动,都有一个共同的前提:它们必须从零开始训练模型。
对于已经完成预训练的 foundation models 而言,强行更改 Embedding 结构或位置编码会破坏模型已有的语言能力。这种高昂的重新训练代价阻碍了架构级改进的落地。重新训练大模型不仅需要昂贵的算力开销,还会面临模型原有逻辑理解力和常识能力退化的风险,这在商业工程实践中是难以承受的负担。
预训练模型的落地路径
对于已成型的预训练大模型,目前最有效的改进路径依然是在软件工程外围进行优化:
- 监督微调 (SFT):在微调阶段混入大量不同格式、不同尺度的数值样本,促使模型在隐藏层中建立起相对线性的量级映射关系。这能帮助模型部分修复表征接地的缺陷,使其在数字的大小比较上表现出更好的单调性。
- 推理时外部脚手架:与其让大模型用神经元进行复杂的数值计算,不如直接通过 Tool-use 将其剥离。大模型负责进行高阶数学逻辑的拆解,一旦遇到具体的数值计算,则自动调用外部的 Python 代码执行器(Code Interpreter)来算出结果。
将高风险的计算过程托管给确定性的规则系统,是当前提升 Agent 复杂任务成功率的最佳选择。通过建立类似计算器插件的工具边界,大模型只扮演调度者和解释器,复杂的加减乘除和金融算术则被完全外包给没有误差的底层代码,这使得整个系统的鲁棒性得到了本质上的提升。
参考文献
Ni, A., “Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement,” arXiv: 2608.13129, https://arxiv.org/pdf/2608.13129