先回答一个问题:DeepSeek Harness和Codex、Claude Code有什么区别?

他们本质上都属于“把大模型变成能干活的 Agent 的那一层软件”。

他们都有“Harness”,只是:

DeepSeek 把 Harness 本身做成了产品主角和可编程框架,而 Codex / Claude Code 更优先把“已经组装好的编程 Agent”交给用户。


建立一个最简单的心智模型

Agent包含这些环节:

图片

模型只是“大脑”。

如果你直接调:

<span leaf=""><span>response</span>&nbsp;= llm(”帮我开发一个网站”)</span>

模型最多告诉你应该写什么代码。

而 Codex / Claude Code / DeepSeek Harness 会形成这样的循环:

  • 用户:做一个网站

  • 模型思考

  • 读取目录

  • 读 package.json

  • 写文件

  • npm install

  • npm run dev

  • 发现报错

  • 读取错误

  • 修改代码

  • 运行测试

  • 继续……

负责把这个循环组织起来的东西,就是广义的 Harness。

OpenAI 自己甚至明确把 Codex CLI 内部这层称为Codex harness,并公开讲解它的 agent loop 如何协调模型、工具、prompt 和执行。(https://openai.com/index/unrolling-the-codex-agent-loop/)

所以:

DeepSeek、Codex、Claude Code 背后都有 Harness。

DeepSeek 的特别之处,是把 Harness 本身完整地摆到了开发者面前。


那 DeepSeek Harness 和 Codex 到底差在哪?

用一句话概括:

Codex 更像一辆性能已经调好的汽车;DeepSeek Harness 更像一套允许你换发动机、变速箱、仪表盘甚至驾驶逻辑的造车平台。

而且这里千万不要把 Codex 想得过于封闭。

现在的 Codex CLI 本身就有开源 Agent 实现,OpenAI 还提供 Codex SDK,Codex CLI 的 Responses API endpoint 也是可配置的。(https://openai.com/index/unrolling-the-codex-agent-loop/)

所以两者其实存在大量重叠。

图片

以 Claude Code 为例,其实它也已经非常可扩展了:官方提供 Skills、hooks、MCP、subagents 和 plugins,plugin 还能打包 skills、hooks、subagents 和 MCP server。(https://docs.anthropic.com/en/docs/claude-code/features-overview)

真正区别是扩展的深度和架构中心不同。


DeepSeek Harness 最特别的到底是什么?

DeepSeek 官方架构文档明确写了:

model adapter、tool registry、session log、agent loop 全部都是 plugin,因此可以通过配置替换。(https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/architecture.md)

这个设计非常激进。

普通 Agent 框架一般长这样:

<span leaf=""><span>Agent</span>&nbsp;Loop</span>

你可以在该Loop中插入各种Model、Tools、Memory等,但最外面的:

<span leaf=""><span>while</span>&nbsp;<span>true</span>:</span>

通常是写死的框架。


DeepSeek Harness 的思想更像是:

<span leaf=""><span>Cordis</span>&nbsp;Runtime</span>

也就是说:Agent Loop 竟然和 Shell 从架构哲学上处于同等位置!

没有一个特别神圣、不可替换的“Agent 核心”。

官方明确写道:

“There is no privileged core to patch.” —— https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/architecture.md

也就是,没有一个特殊的“核心”要求你魔改,扩展DeepSeek Harness的方式,是在旁边再挂一个插件。

这才是“一切皆插件”真正有意思的地方。


举个容易理解的例子

假设你现在想研究一种新的 Agent 策略。

比如普通 Agent:

<span leaf="">任务</span>

你突发奇想,设计一种:

<span leaf="">任务</span>

如果你使用 Claude Code:

你可能会利用:Subagents、Skills、Hooks、MCP 去实现它。

你本质上还是在Claude Code 已经设计好的产品结构里扩展 Claude Code。

Claude Code 的官方扩展层就是围绕 Skills、subagents、hooks、MCP 和 plugins 来组织的。(https://docs.anthropic.com/en/docs/claude-code/features-overview)


但在 DeepSeek Harness 里,它更希望你:

直接写一个新的 Agent Loop plugin !

然后:

<span leaf="">agent-<span>loop</span>:</span>

整个运行时换掉。

于是:DeepSeek Harness 最终可能变成:

  • 科研 Agent

  • 浏览器 Agent

  • 数据分析 Agent

  • 量化研究 Agent

  • 机器人 Agent

  • 游戏生成 Agent

  • 企业自动化 Agent

这就是它和 Claude Code / Codex 在产品定位上的最大区别。


其实 Codex 已经处在两者之间

搞清楚 DeepSeek Harness 的能力和定位后,不禁想问,难道Codex没有这些能力吗?

现在的 Codex 已经不只是一个 CLI。OpenAI 有:

  • Codex CLI

  • Codex SDK

  • Codex Cloud

  • Codex app / ChatGPT 中的 Codex

  • MCP

  • Multi-agent Workflow

  • ……

而且 Codex SDK 的定位就是把“驱动 Codex CLI 的同一个 Agent”嵌入你自己的 workflow 和应用。(https://openai.com/index/codex-now-generally-available/)

上文也提到,OpenAI 官方曾经直接把 Codex CLI 背后的东西叫 Codex harness(https://openai.com/index/unrolling-the-codex-agent-loop)

因此真实关系更像:

图片

它们其实是同一个技术栈里的不同产品取向。


正确看待Harness

很多媒体提到:

DeepSeek V4 Flash 参数更少 –> 做游戏却比 GPT-5.6 sol + Codex 好 –> 所以 DeepSeek Harness 比 Codex Harness 强

这种 one-shot Agent demo 极其容易受到下边这些因素的影响:

  • system prompt

  • 工具定义

  • 工具数量

  • agent loop

  • 上下文压缩

  • subagent 策略

  • 网页/视觉能力

  • 任务拆解方式

  • token budget

  • 执行时间

  • 随机采样

  • ……

模型能力 × Harness 能力才是最终 Agent 能力

所以DeepSeek V4 + DeepSeek Harness 得到了更好的结果不能单独归因于 Harness,更不能由一个 demo 判断总体优劣。


DeepSeek Harness是最好的Agent架构吗?以及Agent的下一层竞争

现在我还不能下结论,但:

它提出了一种非常清晰的判断:未来不会只有一个超级 Agent,而会有大量不同 Agent,它们应该共享一套 Agent Runtime,而不是每个 Agent 从头造轮子。

相比于这个问题,我更想知道,如果 Harness 越来越成熟,那么未来真正有价值的“Agent 创新”会发生在哪里?

因为假设Session、Memory、Tools……最后都变成了公共基础设施,那么工程师真正需要创新的,可能逐渐从

“我也做一套 Agent 框架”

变成:

“我要设计一种独特的 Agent behavior / loop / environment interaction。”

用一幅图来说明:

图片


做时间的朋友

DeepSeek Harness 最终会不会成为主流,甚至 Cordis 这种微内核式的设计是不是 Agent Runtime 的最佳答案,都还需要时间验证。

但Deepseek让我们看到,如果 Harness 这一层继续成熟,文件系统、Shell、Browser、Memory、Session、Sandbox、Sub-agent、Context Management 这些能力逐渐变成公共基础设施,那么下一阶段真正形成差异的,可能又会继续向上移动。

过去,模型本身就是产品最重要的资产;

现在,模型需要一套足够好的 Harness,才能真正进入现实世界;

而未来,一个 Agent 究竟“是什么”,可能越来越取决于它如何行动、生活在什么环境里,以及如何从一次次行动的结果中继续学习。

Agent,最终会成为一个完整的系统,DeepSeek Harness 未必是这个系统的最终答案,但它已经把这个问题摆到了桌面上。