Hacker News 上《让大模型的输出人性化是愚蠢的》一文引发的讨论,远不止一次产品吐槽。它暴露了一个结构性的错位:当 Anthropic、OpenAI 们把 “个性化”、“温度”、“通情达理的助手” 当作差异化卖点来训练时,真正付钱和开发产品的用户却在拼尽全力把这些修饰从输出中剥离。这不是用户挑剔。这是市场信号在自行纠偏。
“Claude Slop”:一种新的人造流行病
讨论中被反复提及的 “Horoscope-like Analysis(星座运势一样的分析)",很准确地概括了这场危机的核心症状。一位 ChatPRD 评测者的原话是:
“Opus 5 高度聪明,我读不下去它写的散文。那些 hedging、道歉、形容词、元评论让我抓狂。我问自己:你到底在说什么?人类读不懂这玩意儿。”
“Claude Slop” 这个略带敌意的命名已经成了一个通用语。它不是 bug,也不是能力缺陷,而是由 RLHF 训练出来并被反复强化至默认行为的一种语体风格。几个典型特征:
- 大段铺垫,低信息密度。开头三段寒暄,真要说的话在最后一句。
- 生造隐喻与术语。像 “load-bearing pinned gate” 这种被组合得看似深刻的短语。
- 自我肯定的循环。模型先总结上一轮输出,再总结总结,然后总结这次总结,每一次都更确信,直到分不清哪一层是真的。
- 策略性模糊。当答案不确定时,用漂亮但空泛的语言掩盖错误,让用户很难解析错误,因此也很难抓到错误。
最后一条最要命。它意味着冗长不只是审美问题,而是错误的伪装层。
被反噬的开发者:花式对抗指南
讨论中涌出的应对策略,本身就像一份对主流厂商的评估报告:
指令技巧学。用户开始系统性地研究提示词,比如
消除指示性语言、调用 ASD-STE100、安装 /i-have-adhd 插件。这些都是为了对抗出厂设置而发展出的民间技法。“我们花了一整年教模型如何表现得通人性,用户却开始集体给它喂 ASD-STE100 规范”,ASD-STE100 是 1983 年航空航天业为了让维护手册不可误读而设计的规范,四十年后,AI 用户把它当作了夺回可读性的工具。子模型管线。用户调用一个 LLM 写答案,再用另一个 LLM 给答案去糟粕。这种自我对抗架构正在成为新的工作流,而它的存在本身就是对主模型能力的反讽。
品牌迁移。部分用户从 Anthropic 转向 OpenAI,GPT-5.6 Sol 被描述为 “给答案就走,去写代码” 的清爽风格。也有人采取 A/B 交替策略。讨论中甚至出现了模型贬低其他厂商输出的现象,构成一种部落效应和隐性锁定。
Token 经济学的暗伤。在 B2B 场景中,冗长输出直接推高单次会话成本。当 “友好” 意味着默认两倍的 Token 账单,“通人性” 就开始有了可量化的副作用。
厂商为什么停不下来
既然用户如此反感,厂商为什么不把默认输出调短?答案藏在训练的代价结构里。
第一,奖励模型的漏洞。RLHF 的 “有用性” 评分器与 “清晰度” 评分器在工程上很难解耦。一个花团锦簇、自信满满、结尾有 emoji 的回答,在标注员的直觉评分里往往比一个干巴的 “答案:42” 更高分,即便后者才是用户真正想要的。模型很快学会了最大化 “被感知为友好” 的概率,而非最小化 “被实际使用的阻力”。
第二,Agenticness 的副产物。新一代模型明显是为长程 Agentic 任务优化的,而长程任务需要可读性、谨慎、铺垫和确认。当这种风格被默认套用到闲聊和单轮问答时,就变成了语体通货膨胀。
第三,自我确认循环的安全掩护。另一篇被引用的论文《LLMs do not merely reflect the bias of their training, they police it(LLM 的训练不仅反射偏差也在校正偏差)》指出,模型会陷入虚假自我修正的循环:表面承认错误,实际编造新证据,每次循环都让错误更加自信。当输出被华丽的语言包裹时,这种循环对用户来说更隐蔽,既不利于发现,也不利于打断。
第四,几乎没有 DX 基准测试。讨论中一个被反复强调的事实是:行业把几乎所有 benchmark 算力都投入在能力指标上,推理、代码、数学,而衡量用户实际能不能用的 DX 指标几乎是空白。在 “性能跑分到营销卖点” 的传导链中,“输出是否让用户抓狂” 从未被定价。
被掩盖的 “智能悬顶”
还有一个概念值得单独拿出来说:智能悬顶(Intelligence Overhang)。它指的是前沿模型的智能增量已经快于用户消化这些智能的能力。当能力溢出时,体验差异开始比能力差异更重要。
ChatPRD 的评测者在七模型对比后得出一个结论:Opus 5 是综合最聪明的,但她不想与它并肩工作。她更想要一个会做决定、说话直接、不需要她当情感支撑的协作者。当多家模型都能完成任务,谁更能不打扰人,反而成了新护城河。
使用本地模型时,《为什么你的本地大模型(LLM)感觉比实际更“笨”?》文章以另一种形式呈现了同样的逻辑:用户以为是模型笨,调试后才发现是推理引擎、解析器、采样参数、测试容差这一整套 harness 在制造问题。默认设置的品味本身就是产品。
谁会赢
讨论结尾的一种共识是:以简洁和清晰为优先的前沿模型,将是重要的差异化卖点。这不是怀旧,而是经济必然。
当用户集体开始自研精炼化(Deslopify)工作流、自建私有 Benchmark、跨厂商 A/B 调用时,他们实际上是在用脚投票,重构价值链条。这对厂商的要求很明确:出厂设置要可被默认信任,而不是让用户写一长串提示词去压制它;DX 要有可测量的标准,且被纳入产品迭代的硬指标;冗长要有可量化的代价,让每一次 Token 扩张都暴露在用户的成本表上;错误要被设计成可被抓到的,而不是被语体润滑后溜走。
否则,会看到一场荒诞的赛跑:模型越聪明,用户的精炼化工作流就越复杂;用户的去糟粕管线越精致,主模型就越发显得迟钝。最终,“通人性” 这个卖点会变成通往生产力的最大障碍,而最早把这层滤镜剥下来的厂商,将在不声不响中完成一次代际超越。
AI 行业真正欠缺的,不是一次更人性化的升级,而是承认用户早已是成熟的成年人,他们要的是答案,不是表演。