Aug 14
被数字困住的大模型:数值接地框架与算术硬伤
大语言模型可以解决复杂的数学竞赛题,却经常在最基础的小学算术上出错。
判定 9.11 大于 9.9 并不是个案。在面对多位数加法、小数乘法以及科学计数法转换时,主流模型同样容易得出错误答案。这种基础数值处理能力的漏洞,在 GPT、Claude 和 Gemini 等前沿模型中普遍存在。这反映出大模型在处理数字时,依然将其作为普通的语义符号进行统计关联,而非将其作为数学数值进行物理量化。
最新论文《大语言模型的数值计算能力:根本局限性与改进路径》(arXiv: 2608.13129)指出,大模型的基本数值处理能力与高阶数学推理是完全独立的维度。模型算术漏洞的根源在于数值接地的失效。
基础数值敏感度与高阶推理的脱钩 很多开发者认为,只要大模型能够看懂高等代数,做加减乘除自然不在话下。为了提升算术能力,常规做法是往训练集中灌入更多数学课本,或者通过思维链拉长模型的推理步骤。
然而,这种做法混淆了推 …
阅读更多
阅读更多