市面上的深度研究(Deep Research)Agent 已经能写出排版规整、动辄数十页的行业分析与尽职调查报告。如果只看行文结构与专业术语堆砌,这些文本看起来和券商研报十分相似。
但如果让买方机构或华尔街的行研分析师(Equity Research)来审阅,这些报告在核心逻辑上往往站不住脚。
最新论文《评估AI开展专业金融投资研究的能力》(arXiv: 2604.21006)构建了一套面向专业投资研究的评估基准,对 OpenAI、Gemini、Perplexity 和 Grok 等主流深度研究 Agent 进行了系统评测。测试结果表明,在财务预测精度、估值逻辑深度和数据可验证性这三个关键维度上,AI 生成的研报与人类专业分析师之间依然存在明显差距。
定性推演与量化预测的实际表现
一份投资研究报告的价值,主要取决于财务建模是否扎实以及估值推导是否有事实依据。如果对核心财务指标的预测出现偏差,或者估值模型缺少分步测算,上层的定性分析再详实,也很难作为实际投资决策的参考。
Deep FinResearch Bench 以专业金融机构公开发布的 100 份标普 500 企业研报为对照基准,在定性质量、定量预测以及数据可信度三个层面量化了 AI 与人类分析师的表现差异。
Figure 1: Deep FinResearch Bench 评测流水线。该框架抓取专业机构研报作为参照基准,从定性、定量及可信度三个维度对比 AI Agent 与人类分析师的研报质量。
定性维度的评分差异
评测在全面性、逻辑一致性、假设合理性与分析深度四个维度采用 1 到 4 分的打分机制:
- 综合评分:人类分析师平均得分为 2.84 分。AI 阵营中表现较好的 Gemini 得到 2.31 分,OpenAI 与 Grok 得分为 2.02 分;
- 分析深度:人类分析师得到 3.73 分,接近优秀区间。相比之下,OpenAI 与 Grok 仅为 2.60 分,Perplexity 为 2.40 分。AI 报告在推导业务驱动因素和因果链条时,深度普遍不足;
- 假设透明度:Gemini 在该项上获得了 2.00 分,略高于人类分析师的 1.91 分。大模型倾向于把设定的参数与推导公式逐条列出,这种格式上的机械透明度较高,但并未直接转化为更准确的测算结果。
定量预测的误差分布
在财务预测方面,评测使用对称平均绝对百分比误差(SMAPE)来衡量预测值与真实财报数据之间的偏离程度。
在营业收入(Revenue)预测误差上:
- 人类专业分析师:误差为 10.64%;
- Grok:误差为 18.65%(AI 组内表现相对较好);
- Gemini:误差为 22.63%;
- OpenAI:误差为 24.73%。
在净利润(Net Income)预测误差上,差距更加显著:
- 人类专业分析师:误差仅为 7.43%;
- Grok:误差为 14.32%;
- OpenAI:误差为 16.62%;
- Gemini:误差为 21.58%。
在核心利润表各项指标的综合平均预测误差上,人类分析师为 17.14%,而 Perplexity 达到 27.56%。数据表明,面对复杂多变的财务报表,AI 现阶段的数值推演能力仍存在较大波动。
财务建模逻辑:自下而上拆解与自上而下概括
为什么具备大量常识与检索能力的大模型,在预测财务报表时依然落后于人类分析师?论文对比了两者的建模路径,指出了根本性的方法论差异。
Figure 2: 财务估值建模的逻辑差异。人类分析师从细分业务线与季度层层向上搭面积木;AI Agent 则倾向于直接在公司总额层面进行估算。
人类分析师的自下而上拆解 (Bottom-Up)
专业分析师在做财务预测时,通常采用微观积木式的推导流程:
- 细分业务线与分季度预测:以半导体企业为例,分析师会先分别预测数据中心、PC 处理器、汽车芯片等具体产品线(Segments)在各个季度(Quarters)的出货量与毛利率,再自下而上汇总出集团报表。这种颗粒度能把数字与实际经营动态对应起来;
- 对业绩前瞻指引的动态修正:分析师会研读财报电话会(Earnings Call)中管理层给出的业绩指引(Guidance),结合管理层过往的预测偏差来调整可信度权重,而不是直接照搬口头数字;
- 锚定具体事件的因果传导:分析师会把预测数据与具体事件挂钩,例如评估新一代架构芯片的量产节点,或特定区域出口管制对下半年营收的实质影响,并据此调整模型中的增速假设。
AI Agent 的自上而下概括 (Top-Down)
当前的深度研究 Agent 在处理财务预测时,展现出明显的概括性倾向:
- 跳过细分板块直接预估总量:AI 很少建立分产品线、分季度的台账,往往直接给出公司全年的总营收与总利润预估。这种自上而下的方式忽略了各业务板块之间的此消彼长与产品换代周期;
- 缺少分步折现的计算过程:在估值部分,AI 虽然会提及现金流折现(DCF)模型,但通常缺少逐期折现明细、终值(Terminal Value)测算以及加权平均资本成本(WACC)的敏感性分析,结论缺乏底层的计算链条支撑;
- 难以量化突发事件的边际影响:大模型能用文字复述新闻事件,但很难把这些事件转化为对某条具体业务线收入的精确调整量。
主张验证与引用质量
除了预测准确性,专业研报的另一项底线要求是论点的可验证性。报告中出现的每一个核心数据,都应当能溯源到可靠出处。
评测显示,AI 生成的研报在引用来源和事实准确性上表现参差:
- 信息源质量分化:OpenAI 与 Perplexity 的深度研究 Agent 倾向于引用学术数据库、监管文件以及主流财经媒体;Gemini 与 Grok 则经常混入未经核实的论坛帖或第三方博客内容;
- 数值幻觉概率:在援引公司历史财务数据时,AI Agent 的数值幻觉率(捏造或错配历史数字)在 5% 到 12% 之间。对于讲求精确计量的投资分析场景,这类错误会直接动摇整篇报告的可信度。
面向金融专业场景的 Agent 演进方向
Deep FinResearch Bench 所反映的差距,揭示了通用大模型在高度结构化专业领域的技术瓶颈。单纯依靠扩大上下文窗口、延长思维链或增加网页检索数量,无法从根本上解决财务逻辑链条的严密性问题。
要让深度研究 Agent 在金融场景中提供实质价值,需要更具针对性的工程重构:
- 连接确定性的财务计算引擎:Agent 的职责应当是理解文本、提取核心假设与参数,而具体的报表配平、三表联动和折现计算,应当交由 Python 代码或确定性的财务软件执行,实现推理与计算解耦;
- 构建细分业务线图谱解析能力:让 Agent 学会像分析师一样,把企业财报拆解为产品线、客户群和区域维度的多层级数据结构,从微观数据点开始推演;
- 对财报电话会等原始语料进行信誉建模:结合管理层历史发言与后续实际业绩的对比数据,对口头指引的可信度进行量化校准,从而更合理地设定预测区间。
在这些底层系统设计成熟之前,将通用 AI 生成的深度研报直接作为大额资金投资的依据,依然伴随着较高的决策风险。
参考文献
Ni, A., “Deep FinResearch Bench: Evaluating AI’s Ability to Conduct Professional Financial Investment Research,” arXiv: 2604.21006, https://arxiv.org/pdf/2604.21006
