AI 投研边界:金融深度研究的现实差距

2026-06-14
AI 投研边界:金融深度研究的现实差距

市面上的深度研究(Deep Research)Agent 已经能写出排版规整、动辄数十页的行业分析与尽职调查报告。如果只看行文结构与专业术语堆砌,这些文本看起来和券商研报十分相似。

但如果让买方机构或华尔街的行研分析师(Equity Research)来审阅,这些报告在核心逻辑上往往站不住脚。

最新论文《评估AI开展专业金融投资研究的能力》(arXiv: 2604.21006)构建了一套面向专业投资研究的评估基准,对 OpenAI、Gemini、Perplexity 和 Grok 等主流深度研究 Agent 进行了系统评测。测试结果表明,在财务预测精度、估值逻辑深度和数据可验证性这三个关键维度上,AI 生成的研报与人类专业分析师之间依然存在明显差距。

定性推演与量化预测的实际表现

一份投资研究报告的价值,主要取决于财务建模是否扎实以及估值推导是否有事实依据。如果对核心财务指标的预测出现偏差,或者估值模型缺少分步测算,上层的定性分析再详实,也很难作为实际投资决策的参考。

Deep FinResearch Bench 以专业金融机构公开发布的 100 份标普 500 企业研报为对照基准,在定性质量、定量预测以及数据可信度三个层面量化了 AI 与人类分析师的表现差异。

Deep FinResearch Bench 评测流水线

Figure 1: Deep FinResearch Bench 评测流水线。该框架抓取专业机构研报作为参照基准,从定性、定量及可信度三个维度对比 AI Agent 与人类分析师的研报质量。

定性维度的评分差异

评测在全面性、逻辑一致性、假设合理性与分析深度四个维度采用 1 到 4 分的打分机制:

定量预测的误差分布

在财务预测方面,评测使用对称平均绝对百分比误差(SMAPE)来衡量预测值与真实财报数据之间的偏离程度。

在营业收入(Revenue)预测误差上:

在净利润(Net Income)预测误差上,差距更加显著:

在核心利润表各项指标的综合平均预测误差上,人类分析师为 17.14%,而 Perplexity 达到 27.56%。数据表明,面对复杂多变的财务报表,AI 现阶段的数值推演能力仍存在较大波动。

财务建模逻辑:自下而上拆解与自上而下概括

为什么具备大量常识与检索能力的大模型,在预测财务报表时依然落后于人类分析师?论文对比了两者的建模路径,指出了根本性的方法论差异。

AI 与人类估值建模对比

Figure 2: 财务估值建模的逻辑差异。人类分析师从细分业务线与季度层层向上搭面积木;AI Agent 则倾向于直接在公司总额层面进行估算。

人类分析师的自下而上拆解 (Bottom-Up)

专业分析师在做财务预测时,通常采用微观积木式的推导流程:

AI Agent 的自上而下概括 (Top-Down)

当前的深度研究 Agent 在处理财务预测时,展现出明显的概括性倾向:

主张验证与引用质量

除了预测准确性,专业研报的另一项底线要求是论点的可验证性。报告中出现的每一个核心数据,都应当能溯源到可靠出处。

评测显示,AI 生成的研报在引用来源和事实准确性上表现参差:

面向金融专业场景的 Agent 演进方向

Deep FinResearch Bench 所反映的差距,揭示了通用大模型在高度结构化专业领域的技术瓶颈。单纯依靠扩大上下文窗口、延长思维链或增加网页检索数量,无法从根本上解决财务逻辑链条的严密性问题。

要让深度研究 Agent 在金融场景中提供实质价值,需要更具针对性的工程重构:

在这些底层系统设计成熟之前,将通用 AI 生成的深度研报直接作为大额资金投资的依据,依然伴随着较高的决策风险。


参考文献

Ni, A., “Deep FinResearch Bench: Evaluating AI’s Ability to Conduct Professional Financial Investment Research,” arXiv: 2604.21006, https://arxiv.org/pdf/2604.21006

© 2026 Hot Ingest