当LLM社区为"思维树"(Tree of Thoughts, ToT)摇旗呐喊,声称这是大模型"类人推理"的里程碑时,一篇来自arXiv的论文冷冷地揭开了底牌:你们花了三年时间、堆了无数GPU、烧了亿万美元重新发明的东西,是计算机专业大一学生第一学期算法课第一章的课后习题。
这篇题为《Tree of Thoughts as a Classical Heuristic Search Problem》的研究,用近乎残忍的学术严谨性,将LLM社区引以为傲的每一个"创新组件"逐一拆解,对应到经典启发式搜索的理论框架中——然后得出了一个让整个NLP圈尴尬到脚趾抠地的结论:ToT不是一项新技术,它是经典搜索算法在语言模型上的降维寄生。
算法考古:一场精心包装的复古运动
让我们来做一次算法考古。
LLM社区花了几年时间,把ToT包装成"范式跃迁"。论文堆积如山,benchmark被反复刷榜,创业公司融资一轮接一轮,宣传话术里充斥着"涌现"、“深思熟虑”、“多路径探索"这类令人血压飙升的词汇。然而,当你把Transformer架构、注意力机制、价值数十亿美元的GPU集群全部剥掉,剩下的东西是——**一棵搜索树。**是的,迪杰斯特拉(Dijkstra)、麦卡锡(McCarthy)和纽厄尔(Newell)在1960年代就玩剩下的那种数据结构。
这篇论文用手术刀般的精度切割出了事实:ToT的设计模式收敛于一个极小的经典搜索算法集合——**浅层确定性任务用BFS,深度推理用DFS和MCTS。**这不是什么洞见,这是任何一本入门AI教材的第一章到第三章。
LLM领域的"创新”,相当于一个厨师花了五年时间研究如何烧开水,然后宣布自己发明了汤。
更令人窒息的是这份无知的体量。启发式搜索社区花了六十年开发出越来越精密的算法:带可采纳启发式的A*、面向内存受限环境的IDA*、递归最佳优先搜索RBFS、有限内存的SMA*、结合UCT选择的MCTS、对抗性场景下的alpha-beta剪枝、迭代加深、双向搜索,以及各种约束满足技术。而主流LLM论文中的ToT实现呢?**原生态BFS和DFS。**这在算法层面相当于开着独木舟横渡太平洋,而航空母舰就停泊在港口。
大模型的搜索傲慢:当古典优势变成时代包袱
讽刺在这里达到了沸点。LLM社区最大的卖点一直是语言模型推理的"通用性"和"灵活性"——你可以用自然语言描述任何问题,模型"理解"它,然后生成推理步骤。这被包装成对经典AI规划的范式颠覆,因为后者需要形式化的问题表示。
但这篇arXiv论文把这个叙事完全反转了。**ToT的灵活性恰恰是它的根本弱点。**在经典规划中,你拥有定义良好的状态空间、确定性的状态转移、可验证的目标条件。在ToT中,一切都是随机的:同一个"思维"可能生成截然不同的后继状态,“启发式"是一个学习得来的函数,可能严重失准,状态空间由语言嵌入定义而非形式逻辑,而"目标测试"基本上就是让LLM批改自己的作业。
(是的,幽默不?)让一个随机黑盒评估自己生成的随机输出,然后宣布这是"推理”。
论文特别强调了ToT的四个特性,是经典搜索社区从未需要面对的:随机后继生成(相同输入产生不同输出)、学习得来的启发式(评估函数是一个具有不可预测失败模式的神经网络)、语言学状态空间(状态是高维且语义模糊的)、计算预算约束(每次LLM调用都意味着金钱和延迟成本)。
这不是什么新前沿,这是**披着进步外衣的倒退。**LLM社区把定义良好、数学上严格的搜索问题,转化成了随机的、不可解释的、昂贵的近似。1960年代的搜索算法之所以有效,是因为问题定义清晰。ToT之所以"有效",是因为问题定义模糊到几乎任何结果都可以事后合理化。
被忽视的六十年算法遗产
LLM领域围绕"提示技巧"和"推理链"构建的自吹自擂的叙事,制造了一个危险的盲区。论文指出,当前的LLM智能体生态不是由独特的提示创新组成的。它是由成熟搜索算法的特定实例化组成的——LLM社区没有认识到这些算法,更遑论对其进行优化。
错失的机会清单令人震惊。这包括但绝不限于:面向最优路径搜索的带领域启发式的A*、面向内存受限最优搜索的IDA*、平衡探索与利用的UCT增强MCTS、任意时段的RBFS、硬内存限制下的SMA*、保证完备性的迭代加深、已知起止状态下的双向搜索、对抗性推理的alpha-beta剪枝、结构化领域的约束传播,以及增量改进的任意时段修复算法。时代抛弃你时,连一声报错都不会有。
LLM领域拥有每次查询运行数百万次搜索迭代的计算资源,却缺乏有效使用这些资源的算法素养。每一篇自豪地展示benchmark上5%提升的ToT论文,本质上都是在用2020年代的硬件运行1950年代的算法,却没有意识到一个精心调优的A*很可能在10%的算力下达到同样的结果。
终局:趋势差的终极审判
到了这个节点,可预见的反驳已经排好队:“但LLM在做根本不同的事情。它理解语言。它具有涌现能力。“这恰恰是那种会被时代碾碎的静态思维。
**看静止的绝对指标是弱者的自我安慰,结构性算法更迭带来的效率斜率,才是决定生死的底牌。**LLM领域目前通过benchmark准确率来衡量成功。启发式搜索领域通过扩展节点数、解的最优性和收敛保证来衡量成功。当这两套指标碰撞时,LLM领域将发现:它的万亿参数模型正在用暴力破解玩具问题,而一个设计良好的搜索算法在微秒级就能给出相同答案。
趋势已经清晰:随着LLM推理成本承压,领域从"它能推理吗"转向"它能高效地推理吗”,理解经典搜索理论的团队将主导一切。今天部署的ToT框架,1960年代的人会称之为"演示系统”。2030年的生产系统将完全不是这副模样,因为算法基础将终于被夯实。
这篇arXiv论文的结尾是对搜索社区的呼吁。但真正的呼吁应该指向LLM社区:**停止重新发明轮子,去读一读说明书吧。**你需要的算法在你们的GPU制造出来之前就已经发表了。唯一的问题是,你能否在市场之前想明白这件事。
本文基于 arXiv:2605.28566(Tree of Thoughts as a Classical Heuristic Search Problem: Formal Foundations and Design Patterns)
