当科技公司用"通用人工智能"、“超级智能”、“AI觉醒"等词汇疯狂营销时,一项覆盖303位跨学科研究者的调查,用数据给这个燥热的舆论场浇了一盆冰水:我们连"什么是智能"都没有共识,凭什么说LLM已经"智能"了?
一篇最新论文(2505.20959)系统性地调研了学术界对"智能"概念的理解,以及对当前LLM系统的评价。这项研究的结论既令人意外,又在情理之中——智能的核心特征确实存在高度共识,但对LLM的"智能"属性,学术界的态度远比公众认知的更加保守和审慎。
归纳、适应、推理:三大支柱形成共识
调查首先探究了一个基础问题:研究者们认为"智能"的核心特征是什么?
结果显示,无论学科背景(计算机科学、认知科学、神经科学等)、职业阶段(学生、助理教授、终身教授等)、研究领域(AI/ML、NLP、机器人等),受访者对"智能"的核心特征形成了惊人的共识:
第一支柱:归纳(Generalization)——从有限经验中提取普适规律,并应用到未曾见过的新情境。这是智能最核心的定义性特征,也是机器学习理论的核心关切。
第二支柱:适应(Adaptability)——在变化的环境中灵活调整策略,而不是依赖固定规则。这包括快速学习新任务、迁移已有知识到新领域、应对长尾和分布外场景等。
第三支柱:推理(Reasoning)——基于已知信息进行逻辑推导,产生新的知识和洞见。这涉及因果推理、演绎推理、反事实推理等多种形式。
更有趣的是,这三个特征之间存在强正相关——认为"归纳"重要的人,往往也高度评价"适应"和"推理”。这表明当前的学术共同体对智能有一个相对统一的心智模型,尽管每个人对具体特征的权重分配可能有所不同。
但问题来了:LLM到底算不算"智能"?
这是调查最引人注目的部分。研究者的态度分为两个层面:
对当前LLM的评判:71%的受访者拒绝认为当前的大语言模型(如GPT-4、Claude等)是"智能的"。这个数字在AI领域从业者中尤其高——资深研究者比年轻学生更倾向于持否定态度。
对"未来类似技术"的预期:当被问及"基于类似技术的未来系统是否可能具有智能"时,否定态度显著下降。这揭示了一个微妙的认知模式:研究者们并不排斥"硅基智能"的可能性,但他们认为当前的技术尚未达到这个阈值。
一个令人不安的关联:研究目标影响智能判断
调查还发现了一个可能涉及"认知偏见"的有趣现象:
那些将"构建智能系统"列为自身研究目标的研究者,更倾向于认为当前的LLM已经具有智能。
这是一个细思极恐的发现。如果一个人相信"创造智能是可能的,并且是我的使命",那么他是否更可能对"什么是智能"设置一个更低的门槛?或者反过来,那些设置高门槛的研究者是否更难以"建造者"而非"评估者"的身份参与这场讨论?
论文作者将这种现象描述为一种自我服务偏差(self-serving bias):研究者的学术身份认同会影响其对研究对象的判断。当你自己在为"让机器变智能"而努力时,你会更容易相信机器已经变得智能了。
为什么这个调查值得认真对待
这项研究的价值在于它捕捉了AI领域的一个深层张力:
一方面,AI研究社区拥有丰富的理论框架和实验方法来定义和评估智能;
另一方面,这个社区对"智能"这个核心概念的理解,比表面上看起来更加分裂和主观。
当ChatGPT发布时,媒体和公众为之疯狂,OpenAI等公司趁势推出"AGI"、“超级智能"等概念营销。但学术界的反应要冷静得多——
只有16.2%的受访者将"开发智能系统"列为自己的研究目标。绝大多数研究者做的工作,是增进对智能的理解,而非构建智能本身。
这种学术界的"去魅"立场,与工业界的"拟人化"叙事形成了鲜明对比。
LLMs的"智能"争议:定义即战场
论文指出了一个根本性的问题:“智能"这个术语在学术讨论中几乎没有被精确定义。研究者们凭直觉使用这个词,但在需要精确界定时,往往陷入分歧。
这也是为什么调查发现"通用化能力"被高度认同为智能的核心——因为这是唯一一个在符号主义、连接主义、行为主义等不同范式间都能找到共鸣的概念。
而LLM面临的批评,恰恰集中在"泛化能力"的不足:当前系统在分布内数据上表现惊人,但在分布外、跨领域、长程推理等场景下能力断崖式下降。这与研究者们对"智能"的期望形成了根本性的落差。
我们能从这个调查中带走什么
第一,智能研究需要更精确的概念框架。当"智能"可以被不同研究者赋予截然不同的含义时,在这个概念上建立"AGI"之类的宏大叙事就更加可疑。
第二,工业界的营销叙事与学术界的真实认知之间存在巨大鸿沟。71%的拒绝率是一个相当高的数字,考虑到受访者都是对这个领域有一定了解的研究者。
第三,LLM的"智能"问题不是科学问题,而是哲学问题。在科学家们还在争论"意识的边界在哪里"的时候,讨论"LLM是否智能"注定是一个没有休止符的辩论。
但至少,这项调查告诉我们一件事:在AI领域,“智能"依然是一个需要被谨慎使用的词——它承载的重量,比大多数人的想象要沉重得多。
相关论文:arXiv:2505.20959 - “Research Community Perspectives on ‘Intelligence’ and Large Language Models”
