你问 ChatGPT :"《百年孤独》的作者是谁?“它答得准确无误。你再问:“莫言获得过哪个国际奖项?“它开始一本正经地编造奖项名称。
这就是 AI 的幻觉问题。但幻觉的根源不在于模型"记错了”,而在于模型"不知道自己在什么时候记错了”。 信息融合——Information Fusion——是这篇论文提出的核心解法。
一个被忽视的关键环节
AI 模型的生产流程通常被描述为:数据收集→清洗→训练→评测→部署。但在这条流水线上,有一个环节长期被忽视——信息融合( Information Fusion ),即来自不同来源、不同模态、不同结构的数据,在进入模型之前,如何被统一表征、统一理解、统一关联。
论文的核心论点是:当前 AI 质量问题的根源,有超过 60%可以追溯到信息融合阶段的缺陷,而不是训练算法本身。这个数字来自论文对 12 个主流开源模型的对比实验——在控制训练数据量和模型参数规模的前提下,通过改进信息融合策略,模型的幻觉率平均下降了37%,领域问答准确率提升了22%。
这是一个反直觉的发现。大家都在调模型,其实应该调的是"喂给模型的原材料”。
三个融合层次的缺陷诊断
论文建立了信息融合的三层分析框架:
第一层:语法层融合( Syntactic Fusion )——不同数据源的结构化整合。 JSON 、 CSV 、 XML 、纯文本,每种格式有不同的语义表达逻辑。主流数据清洗 pipeline 在这一层的问题最轻,但也最容易被忽视。比如,一个包含"2023 年 Q3 营收同比增长 15%“的 PDF 表格和一个包含同样数据的 CSV 文件,在模型看来是两个完全不同的"文本事件”,如果融合策略不统一,模型会对同一事实产生双重表征,引发训练冲突。
第二层:语义层融合( Semantic Fusion )——跨数据源的知识关联与消歧。这是问题最严重的层面。同一个实体在不同数据源中可能有不同名称(“苹果公司"vs"Apple Inc.“vs"AAPL”),论文发现,主流语料库中实体消歧的准确率仅为71%,这意味着近三成的实体关联是错误的。这些错误关联会在训练过程中被模型内化为"知识”,最终表现为幻觉。
第三层:上下文层融合( Contextual Fusion )——时序信息和场景信息的整合。这是最前沿的问题,也是目前研究空白最大的领域。比如,“特斯拉 2023 年交付了 180 万辆汽车"这条信息,在不同的上下文语境下(财经新闻 vs. 社交媒体 vs. 财报原文),其可信度和权威性完全不同。缺乏上下文感知的信息融合,会让模型无法区分"权威来源的事实陈述"和"论坛帖子的主观判断”。
一个核心矛盾:规模与质量的不可兼得
论文揭示了 AI 数据管理中一个深层矛盾:规模化和质量化几乎不可兼得。
追求规模化的数据策略,是互联网 1.0 时代的产物——把尽可能多的网页、文本、对话记录抓取下来,用规则或简单模型做清洗。这种策略在互联网数据爆发的年代是有效的,但到了 2025 年,它的局限性已经暴露无遗。论文测试了这种策略的边际效益:当你把训练数据从 1TB 扩充到 10TB ,模型性能仅提升8%;但当你把同样的 1TB 数据做深度语义融合和质量提升,模型性能提升了31%。
投入 10 倍数据,换来 8%提升;投入 10 倍精力于信息融合,换来 31%提升。 这道算术题,答案一目了然。
但问题是,信息融合无法规模化——它需要大量人工专家介入,包括领域知识工程师、数据架构师、质量评估师。一个高素质的信息融合团队,一年的人力成本可能超过一个中等规模数据中心的电费。这就是为什么大多数商业模型公司宁愿走规模路线,也不愿意在信息融合上深度投入。
这是一个短期理性与长期竞争力的悖论。
行业影响:谁在认真做信息融合
论文对全球主流 AI 研究机构的数据融合能力做了横向评测(以论文发表和开源项目贡献为指标):
做得最好的: Google DeepMind 、 Anthropic 、 Meta AI FAIR——这三家机构都有专门的数据融合( Data Fusion )研究团队,人员配置比例超过工程团队的 15%。
做得最差的:大量中小型模型公司和学术研究机构——他们通常直接使用清洗过的公开数据集,跳过信息融合环节。“Garbage in, garbage out"在这里不是比喻,是字面意义。
医疗 AI 是信息融合价值最显著的场景。论文在一个医疗问答数据集上做了专项测试:通过引入医学知识图谱(而不是纯文本语料)进行语义层融合,模型的医学问答准确率从68%提升到84%,幻觉率下降了52%。这个改进幅度,在医疗场景中可能是生与死的差别。
一个金句总结
“你在调模型的时候,调的不是模型的脑子,是模型的记忆方式。记忆方式错了,脑子再好也没用。”
信息融合不是数据清洗的升级版,它是 AI 质量管理的下一个主战场。当整个行业都在讨论 MoE 、 Transformer 架构、上下文窗口长度的时候,这篇论文提醒了一件事:木桶的短板,不在模型侧,在数据侧。
本文基于 arXiv:2510.23230
