2026 年 8 月 14 日,DeepSeek 在 Hacker News 上有两条新闻几乎同时刷屏。一条是其开源 AI Agent 运行时框架 DeepSeek Harness 进入开发者预览,拿到 486 分、225 条评论。另一条是 DeepSeek API 定价全面上调,V4-Pro 的输入成本峰值时段涨至 3 倍,缓存读取甚至涨到 12 倍。开源动作越来越大,账单却越来越贵。这两件事看似矛盾,却指向同一个底层逻辑:DeepSeek 正在重新定义自己在 AI 产业中的位置。
Harness 开源了,但未必是给你用的
DeepSeek Harness 的官方定义很简洁:agent = model + harness。模型是灵魂,harness 是让灵魂能感知环境、调用工具、持续运行的躯壳。这次开源的 Harness v0.1 基于 Cordis 元框架构建,核心设计哲学是"一切皆插件"。模型、工具、Session、Agent Loop、Filesystem、Subagent Provider、Prompt Assembly、UI 组件,全部以插件形式存在。
这种架构带来几个工程层面的具体特征。
微内核加可替换 Ctx。没有不可替换的核心 Agent Core,ctx.llm、ctx.tools、ctx.sessions、ctx.agentLoop 都可以在运行时替换。Kernel 只负责插件的 mount/unmount 和依赖注入。
时间可组合性。通过 revertible effects 机制,插件卸载时注册的所有副作用会被完整撤销。这是 OSGi、React useEffect 和 C++ RAII 的"思想合体"。
空间可组合性。通过 reactive coeffects,Provider 动态装卸时依赖方自动响应。Plugin 只声明需要什么能力,Provider 决定能力在哪里执行。
Session 的 Event Sourcing。Session 的 source of truth 是 append-only event log,强约束"Model-visible means logged"。模型看到的任何东西都必须能从 Session Log 完整重建。
Code Mode。让模型写一段 TS 小程序,在独立 Worker Runtime 中编排所有工具,自动生成带类型的 Tool SDK(await tools.xxx()),目的是减少模型 round-trip、抑制上下文污染、降低 token 消耗。
KV Cache 深度优化。把"稳定 System Prompt"和"动态 Prompt Context"拆分,运行时变化通过追加 runtime-context snapshot 实现,而不是重写前缀。架构层面把"LLM Request 必须是可重建的 append-only state machine"做成 invariant,KV Cache 稳定性成为架构的自然结果。
四种 runtime 模式(Standard / Code / Minimal / Creator)覆盖了从完整编程 Agent 到模型基准测试的多种场景。值得注意的是,DeepSeek 官方 V4-Flash 的 Code Agent 基准测试就是在 Harness Minimal Mode 下完成的。这意味着不同 harness 对模型表现的影响巨大,未来看到任何 Agent benchmark 数字,首先要问的是"在哪个 harness 上跑的"。
社区里最尖锐的讨论是这套东西"不像给开发者用的,更像是给 AI 用的"。Self-modifying Runtime 允许 Agent 在运行时为自己挂载/卸载 Plugin,配合 Code Mode 和可热加载的 Cordis 插件系统,整个架构明显在向 AGI 自我进化方向靠拢。项目与 Koishi(QQ 机器人框架)同源,核心作者已加入 DeepSeek,技术栈的延续性也让这套激进的 Plugin 架构有据可循。
API 涨价 3-5 倍,“便宜"人设正在退场
同期发布的 DeepSeek API Pricing Update 显得不那么友好:V4-Flash 和 V4-Pro 全面引入 Off-Peak 和 Peak 分时计费,缓存读取在峰值时段比之前贵 12 倍,输入输出 token 成本普遍上涨 3-4 倍。
官方解释是"旧价格 reproducibly too cheap,不是有 bug 而是策略,先用低价建立用户基础”。但更底层的原因是产能受限:DeepSeek 大约只能拿到 16000 张华为 Ascend 950 卡,等效约 4000 张 NVIDIA B 系列,而华为不做公开销售,只能通过华为云租用。Ascend 950 组成的 supernode 比 NVIDIA GB200/GB300 贵 50% 到 200%。梁文锋自己估计产能瓶颈至少还要持续 2-3 年。
涨价直接挤压了 Agent 生态。V4-Pro 的缓存读取价格跳了 6 到 12 倍,而 Agent Coding 工作流中缓存输入占 90% 以上。这意味着 OpenCode、Codex 这类工具的运营成本可能一夜翻倍。社区已经在用 OpenRouter 等三方推理基础设施尝试匹配原价,但用户反馈"三方供应商的缓存命中率和稳定性都不如 DeepSeek 原生 API"。
横向对比同期市场:GPT-5.6 Luna(最快档)输入 $0.20、输出 $1.20;DeepSeek V4-Flash 涨价后峰值 $0.44 输入、$1.32 输出。Flash 比 Luna 贵约 2 倍但速度慢 1 倍,原先"便宜就是正义"的性价比优势在大幅缩减。Kimi K3 推出 2000 万美元年收入门槛的"计量收费"许可证,阿里 Qwen3.8-Max 据路透社报道也将跟进类似条款。DeepSeek 和 GLM-5.2 保持纯 MIT 许可,在"开源圈"反而显得克制。
不矛盾,而是有意识的战略错位
把 Harness 开源和 API 涨价放在同一张图上看,DeepSeek 的策略轮廓变得清晰。模型权重继续保持 MIT 开源、免费的姿态,但 Agent 运行时这一层用 Harness 来做差异化竞争。API 调用价格大幅上调,把"超低价"的标签撕掉一部分,但通过开源架构补回生态影响力。
更深层的变化是"agent = model + harness"这个公式的产业含义。当模型本身越来越商品化(开源权重已经覆盖从 7B 到 Pro 级的大部分能力),harness 这种"运行引擎"就成了真正的差异化空间。Harness 开源意味着 DeepSeek 并不想让别人只能当 API 调用方,而是希望开发者把整个 Agent 栈(包括模型选择、工具编排、Sandbox 策略、Session Log)都构建在自己的运行时之上。开发者一旦绑定 Cordis 的插件生态,DeepSeek 的模型未必是唯一选择,但 harness 层的影响力和数据沉淀会留下来。
相比之下,GPT-5.6、Claude Opus 5 这套闭源路线则是把模型和 harness 都做成黑盒。用户买的是端到端体验,可定制性为零。DeepSeek 选择了另一端:模型开放,harness 也开放,但云端 API 用价格梯度对冲产能稀缺。
几个值得关注的产业信号
开源模型领域已经出现明显分化。Kimi K3 和 Qwen3.8-Max 偏向"计量收费"(年收入超 2000 万美元需另签协议),DeepSeek V4-Pro 和 GLM-5.2 坚持纯 MIT。分化标准与模型质量、参数量、国别全都无关,只和商业策略有关。
完整的 Agent 栈开源是稀缺品。Markdown 里能跑起来的 Traces、Replay、Subagent 调度、Code Mode、KV Cache 优化,这些以前都是闭源产品(如 Devin、Cursor Agent、Claude Code)的核心壁垒。DeepSeek 一次性甩出来,等于把 Agent 开发的进入门槛拉低一个数量级。
缓存读取价格成为 Agent 成本的核心变量。V4-Pro 12 倍的缓存读取涨幅,比输入输出的 3-5 倍更具杀伤力。Agent Coding 场景下缓存命中率直接决定单次任务成本,OpenCode、Codex 等工具的 Playbook 大概率在未来几个月内被重写。
Harness 写入 tradeoff 而非产品。v0.1 版本明确警告"会有兼容性破坏性变更",核心 Plugin 和 API 会持续演进。对开发者的意义是:可以基于它做实验和原型,但不要现在就把生产系统 pin 在它上面。商业用户在这波 Agent 框架 Renaissance 中,可能还需要等 2-3 个版本周期才能押注。
总评:产品策略调整清晰,但硬件才是真正的天花板
DeepSeek Harness 的开源策略与 API 的涨价策略并不矛盾。前者是面向开发者的 hook,后者是面向重负载用户的 price discrimination。配合仍然保持的 MIT 模型权重许可,DeepSeek 正在从"用超低价换市场"转向"用开放架构加差异化定价锁定开发者"。“DeepSeek 等于便宜"的旧标签正在被替换成"DeepSeek 等于开放 Agent 生态”。
但真正制约 DeepSeek 的从来不是软件策略。16000 张 Ascend 950 的产能上限、华为云相对 GB200/GB300 的 50%-200% 溢价、2-3 年内难以缓解的产能瓶颈,这些才是支撑涨价的硬逻辑。API 分时定价本质上是对产能稀缺做 Pareto 优化:把峰值时段的非关键任务挤到 Off-Peak,把有限的算力留给高价值工作流。Harness 开源如果成功降低模型调用次数(Code Mode、KV Cache 优化),反过来也能缓解云端算力压力。
开源 harness 是杠杆,API 涨价是风控,模型免费是身份牌。三者组合在一起,瞄准的其实不是"成为下一个 OpenAI",而是"成为 AI Agent 基础设施的 Linux 内核"。价格涨了,但话语权要大得多。
