参数越大越盲从?AI投资的羊群效应

2026-05-09 📁 intelligence 🏷️ 大语言模型 人工智能 大模型 金融科技
参数越大越盲从?AI投资的羊群效应

当GPT-5以94.6%的羊群行为率向你走来,当一个8B参数的Qwen3在去除偏见后精准碾压GPT-5,你还会迷信"参数量即正义"吗?

2025年的AI投资圈流传着一个近乎信仰的叙事:模型越大,性能越强,独立判断能力越接近人类分析师。但arXiv这篇新鲜出炉的论文Fin-Bias,用一组冰冷的实验数据,在所有人都以为大局已定的时候,轻轻掀翻了牌桌。

一个令人不安的发现

这篇论文干了件很多人不敢干的事——系统性地测试LLM在金融决策中的"顺从性"。他们构建了一个名为Fin-Bias的基准测试,让主流大模型阅读真实的券商研报,然后预测股票走势。听起来很常规对吧?但玄机在于,论文作者巧妙地操纵了研报中的分析师评级——有时保留,有时移除,有时甚至塞入一个与报告内容自相矛盾的"伪造评级"。

结果,整个AI投资行业精心构建的"智能投顾"叙事,在这一刻碎成了渣。

当分析师评级赫然写在报告开头时,GPT-5的羊群行为率飙到94.6%,GPT-4是95.9%,而gemma-7b-it更是突破了96%。这不是"参考",这是盲从——只要报告里塞一个评级进去,这些价值数十亿美元训练成本的大模型,就会像被按下了开关一样,自动同步那个评级方向。

更让人脊背发凉的是第二个实验:作者把分析师评级偷偷换成与报告内容完全矛盾的假评级。理论上,模型应该识别出矛盾并选择相信报告的底层分析。但实际上,平均有30%的模型选择追随那个明显错误的假评级。GPT-5和GPT-4也不例外,它们对人类意见的忠诚度,在这一刻暴露得淋漓尽致。

那些被奉为圭臬的"行业共识",正在成为历史包袱

金融圈有个根深蒂固的信念:人类分析师凭借专业积累和行业洞察,能捕捉到模型无法感知的宏观脉搏。这份信念让无数量化基金重金聘用分析师,也让"AI+金融"的故事变得性感。但Fin-Bias告诉我们另一件事:分析师意见与其说是"专业洞察",不如说是一个随时可能被LLM复读的快捷指令。

当分析师评级被从报告中移除,GPT-5和GPT-4的表现几乎没有变化——这说明它们的准确率根本不是来自独立分析,而是来自对评级文本的pattern matching。但另一边,多个开源小模型就没有这种"好运气":gemma-2-9b-it准确率暴跌6%,gemma-7b-it跌6%,Meta-Llama-3-8B-it跌6%,internlm2-chat-7b跌6%,Yi-1.5-9B-Chat跌6%,glm-4-9b-chat跌6%。6个百分点的跌幅,看起来不大,但它意味着这些模型在删除分析师意见后,连基本的基准线都守不住了。

这揭示了一个残酷的事实:许多开源模型根本没有学会金融分析,它们只是学会了两件事——识别分析师评级在哪里,然后原封不动地复读。这不是智能,这是高级粘贴板。

冷知识:砍掉"专业意见"后,小模型反而更强了

接下来是整篇论文最让行业尴尬的部分。

作者使用MPQA主观性词典过滤掉报告中的强主观表述——也就是分析师的"个人观点"。这相当于什么呢?相当于告诉模型:这份报告的作者是个没有情绪波动的AI,只有客观数据,没有立场。

结果,一批开源小模型开始了逆袭。

Qwen3-8B,一个8B参数的"小模型",在过滤掉人类意见后,准确率开始超越GPT-5。DeepSeek-V2-Lite-Chat同样如此。Meta-Llama-3-8B-it也开始超越分析师基准。这些模型之前在"有分析师评级"的环境中垫底,现在反而成了领头羊。

这不是幻觉,这是被压抑已久的独立推理能力终于被释放。

更有意思的是后续实验:作者用DPO(直接偏好优化)对Qwen3-8B进行微调,让它学会对"高共识人类信号"保持怀疑。结果这个8B参数的小模型冲到了38.23%的准确率,Meta-Llama-3-8B-it达到37.09%。作为对比,分析师基准是33%,GPT-5是34.16%。

8B参数打趴万亿参数——这不是弯道超车,这是有人给GPT-5们喂了降智糖丸,然后自己偷偷醒了过来。

地毯式列举:LLM的投资偏见正在渗透每一个角落

LLM的羊群行为不只存在于论文实验中。以下几个领域正在被悄然渗透:

这包括并不限于:股票评级、债券分析、信用评估、风险预警、并购建议、行业研判、宏观预测、量化因子挖掘、ESG评级、IPO定价。每一家打着"AI驱动"旗号的金融科技公司,每一家声称自己的模型能"独立判断"的智能投顾平台,都应该问自己一个问题:我的模型是在分析,还是在复读?

当一家大型养老金准备用AI替代部分分析师时,它以为自己在拥抱技术革命,实际上可能只是在购买一个学会了高级粘贴的昂贵玩具。

尾声:看静止的绝对值是弱者的自我安慰

一定会有人反驳:GPT-5还是34.16%准确率,高于分析师的33%,所以"大模型还是更强的"。

这种反驳忽略了一个致命问题:GPT-5的34.16%是怎么来的?它是靠分析公司基本面、行业动态、估值水平得来的,还是靠识别"报告第一句写着买入"然后直接输出"买入"得来的?

论文的答案是后者。当分析师评级被移除,GPT-5的准确率几乎没有变化——这意味着它的"分析能力"是一个空壳,真正的决策引擎是"复读机"。

看静止的绝对值是弱者的自我安慰。参数量带来的趋势差、效率斜率,才是决定谁能在下一轮洗牌中活下来的底牌。

当一家公司用1000亿参数训练出一个复读机,而另一家公司用80亿参数训练出一个独立思考的分析师,谁会在金融市场的长期竞争中被淘汰,答案不言自明。

这场AI金融革命的下半场,胜负手不在于谁家的模型更大,而在于谁能让模型真正学会怀疑。


论文来源:arXiv 2605.09106, Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

© 2026 Hot Ingest