当华尔街的Quant们还在用BERT时代的微调模型做金融预测时,一场静悄悄的革命已经在金融AI领域展开——基础模型正在重写整个行业的游戏规则。但问题是:谁将最终统治这个战场?
一篇最新综述(2507.18577)系统性地梳理了金融基础模型(Financial Foundation Models, FFMs)的发展全景图,将这个新兴领域分为三大阵营:金融语言基础模型(FinLLM)、金融时序基础模型(FinTSFM)、金融视觉-语言基础模型(FinVLFM)。这场"三国演义"背后,隐藏着金融AI走向AGI的真正挑战。
从窄到广:金融AI的范式转移
传统金融AI的工作方式是"一个模型,一个任务":情感分析模型做情感分析,风险评估模型做风险评估,股票预测模型做股票预测。每个系统都是独立构建、独立部署、独立维护的"烟囱式"架构。
基础模型的出现改变了这个逻辑。受到GPT系列在通用领域的成功启发,研究者们开始探索:是否可以在金融领域训练一个"通用"的模型,然后通过微调快速适配到各种下游任务?
这个愿景在2018年BERT发布后就开始萌芽,但真正起量是在ChatGPT出现之后。FinLLM、FinTSFM、FinVLFM三个方向的分化,代表了三种不同的技术路线和商业判断。
FinLLM:最成熟,但瓶颈已现
金融语言基础模型是当前最成熟的方向。
FinBERT系列(FinBERT-2019、FinBERT-2020等)开创了金融领域BERT的先河,通过在金融财经文本(新闻、报告、社交媒体)上进行预训练,然后在特定任务(如情感分类、信息抽取)上进行微调。
但FinLLM面临一个核心困境:语言模型的"幻觉"问题在金融场景中格外致命。当一个金融分析师给出错误的投资建议时,后果是真实的金钱损失;而当前的语言模型在面对需要精确数值推理的问题时,往往会"一本正经地胡说八道"。
此外,FinLLM在处理长文档(如完整年报)时的上下文窗口限制,在处理结构化表格时的能力不足,在进行多步骤金融计算时的推理链条脆弱,都是尚未解决的难题。
FinTSFM:最难,但潜力最大
金融时序基础模型是三个方向中技术挑战最大的。
与文本不同,金融时间序列(如股价、利率、波动率)有其独特的统计特性:非平稳性、异方差性、长期记忆、周期性、季节性、宏观周期叠加……这些特性使得直接套用NLP领域的Transformer架构效果往往不如传统时序模型。
FinTSFM的发展路径呈现出两条明显的技术路线:
原生路线:从零开始在金融时序数据上预训练时序基础模型。这条路线的优点是可以针对时序特性进行架构优化(如引入时间卷积、状态空间模型等),缺点是数据规模受限(金融时序数据远少于文本数据)。
适配路线:利用大语言模型的推理能力,通过prompt engineering或微调的方式,让LLM"学会"处理时序任务。这条路线的优点是可以借助LLM的常识推理能力,缺点是"语言模型"的内置偏见可能与时序数据的统计特性不兼容。
FinVLFM:最热,但最难落地
金融视觉-语言基础模型是最近才出现的新方向,主要受GPT-4o等多模态模型的启发。
FinVLFM要解决的核心问题是:如何让AI同时理解财务报表中的表格和文本、股票K线图的技术分析模式、以及公司发布会上的PPT和口述内容?
这听起来像是"多模态大一统"的完美场景,但实际上挑战巨大:
表格理解的深度问题:财务报表中的表格不是"整齐的数据",而是充满合并单元格、跨页表格、注释和附注的复杂文档。当前的多模态模型在处理这种"脏乱差"的表格时能力堪忧。
图表模式识别的语义鸿沟:K线图、均线图、布林带等技术分析图形,承载的是交易员多年实战经验积累的"默会知识"。将这种图形模式转化为可计算的语义表示,目前没有好的解决方案。
多模态融合的时序一致性问题:当文本信息、表格数据、K线图形在时间轴上不一致时(如某个新闻事件对应的是图形上的某个特定形态),如何对齐这些异构信息,是一个尚未解决的难题。
三足鼎立的背后:合规、隐私、数据的三角困境
综述的核心贡献之一是系统性地梳理了FFM面临的三大挑战:
数据挑战:金融数据的特点是"高价值、高敏感、高监管"。获取大规模、高质量、带标注的金融数据本身就是难题;而监管合规要求(如GDPR、CCPA、中国的数据安全法)进一步限制了数据的流通和共享。FFM在数据稀缺的环境中训练,泛化能力必然受限。
算法挑战:金融场景的很多任务是"长程推理"型的(如分析一个公司过去10年的财报变化趋势),而当前Transformer架构的上下文窗口虽然已经大幅扩展,但与真正"理解"一个行业所需要的信息量相比,仍是沧海一粟。
合规挑战:金融是强监管行业。任何AI系统的决策逻辑必须能够被解释和审计,而基础模型的"黑箱"本质与此形成了根本矛盾。当监管机构要求"AI必须能说明为什么给出这个建议"时,当前的基础模型几乎无法满足。
谁将胜出:单模型还是多模型?
综述没有给出明确答案,但提供了一个耐人寻味的观察:
从2018年到2025年,FFM的发展轨迹是从"单模态语言模型"向"多模态融合"演进。这意味着,未来的FFM不会是FinLLM、FinTSFM、FinVLFM中的某一个一统天下,而是需要同时具备处理文本、时序、表格、图形等多种模态的能力。
但实现这个"融合"的技术路径至今不明。是应该训练一个真正"模态无关"的统一基础模型,还是采用"专家混合"(Mixture of Experts)的路由机制,让不同 specialist 处理不同类型的输入?
这个问题没有标准答案。但可以确定的是,在金融这个"性命攸关"的领域,任何技术选择都必须经受监管和市场的双重检验。
对金融工程师的启示
这篇综述虽然是学术论文,但对金融工程师有直接的实践意义:
第一,它提供了当前FFM领域的完整技术地图,帮助从业者理解各种方法的优劣,避免在选型时盲目跟风。
第二,它指出了当前技术的边界,帮助工程师设定合理的预期——FFM不是万能药,在很多场景下,传统方法可能更可靠。
第三,它揭示了未来的研究方向,为研究者提供了切入点。综述开源了GitHub仓库(https://github.com/FinFM/Awesome-FinFMs),持续跟踪FFM领域的最新进展。
当金融工程遇上基础模型,我们正在见证一个价值数万亿美元的战场重新洗牌。而这场游戏的规则,不是由最响亮的营销决定的,而是由最扎实的技术突破书写的。
相关论文:arXiv:2507.18577 - “Advancing Financial Engineering with Foundation Models: Progress, Applications, and Challenges”
