报告日期:2026 年 8 月 14 日。DeepSeek Harness 于 2026 年 8 月 13 日刚刚开源,本报告基于其开发者预览版及 Claude Code、Codex 的公开资料撰写。


〇、先给结论(太长不看版)

三者的关系不是同一层级的竞争

  • Claude Code 和 Codex 是"成品手机"——厂商把模型和外壳(Harness)深度整合,开箱即用,追求的是普通开发者的极致体验;

  • DeepSeek Harness(dsh) 是"手机操作系统"——它不是要给你一部手机,而是要把"造手机的全套图纸"开源,让任何人都能拼出自己的 Agent。

用大白话说:Claude Code 像 iPhone(闭源、垂直整合、体验打磨到极致),DeepSeek Harness 像安卓(开源、可拆解、靠生态取胜),Codex 介于两者之间——开源但交付的是成品,更像"开源版的一加手机"。

至于"颠覆性变革":DSH 的颠覆性不在当下体验,而在产业分工——它试图把 Harness 从各家的"护城河"变成"公共基础设施"。这个判断的详细论证见文末第八节。


一、先把概念说清楚:什么是 Harness?

“Harness"原意是马具、缰绳。在 AI 圈的语境下,DeepSeek 给出的定义最直白:

除模型本身以外,其他一切都是 Harness。 核心公式:Model + Harness = Agent。

用大白话解释:大模型是一匹千里马,力气大、跑得快,但它不会自己认路、不会自己拿东西、也不会自己停下来。Harness 就是马鞍、缰绳、马蹄铁、骑手——让模型在真实世界里"干活"的全套工程系统。它包括:上下文管理、工具调用、任务规划、文件读写、代码执行、权限控制、记忆、重试机制等等。

为什么这个概念在 2026 年突然火了?因为行业共识变了:模型能力已经趋同,真正拉开差距的是"工程外壳”。AI 编程早就过了"模型会不会写代码"的阶段,真正难的是模型能不能在真实代码库里稳定干活——组织上下文、控制迭代次数、把测试失败和日志重新喂回模型。这个"思考→行动→反馈→修正"的长循环能不能跑稳,全靠 Harness。


二、三者定位对比:一张总表

| 维度

|

DeepSeek Harness (dsh)

|

Claude Code

|

OpenAI Codex

本质定位

开源 Agent 运行时框架/底座

|

闭源商业成品编程 Agent

|

开源的成品编程 Agent(内核 + 双形态)

| | 一句话 |

“一切皆插件"的 Agent 操作系统

|

“技术合伙人”,交互式深度协作

|

“执行团队”,本地结对 + 云端委派

| | 厂商 |

DeepSeek(幻方)

|

Anthropic

|

OpenAI

| | 开源协议 |

MIT(完全开源)

|

闭源(二进制分发)

|

Apache 2.0(完全开源)

| | 技术栈 |

Node.js / TypeScript,Cordis 微内核

|

TypeScript

|

Rust(2025 年重写,启动快、长程稳定)

| | 绑定模型 |

不绑定,模型适配器本身也是插件

|

深度绑定 Claude 系列

|

深度绑定 GPT 系列

| | 成熟度 |

开发者预览版(2026-08-13 开源),明确警告"会有破坏性变更”

|

成熟商业产品,年收入据报 25 亿美元量级

|

成熟商业产品,GitHub 80k+ Stars

| | 价格 |

框架免费,只付模型调用费

|

订阅制(Pro $20 / Max $100 月起)

|

订阅制(Plus $20 起,含 ChatGPT)

|

关键区分:Claude Code 和 Codex 是面向终端用户的成品应用;DeepSeek Harness 更偏向底座框架,强调每一层都能被开发者替换和重组,默认自带的 Web UI 与工具集只是其中一种组合方式。


三、原理对比:三家的"世界观"差异

3.1 DeepSeek Harness:一切皆插件(Everything is a Plugin)

DSH 的核心原理激进到近乎执拗:模型适配器、工具注册表、会话日志、甚至 Agent Loop 本身,全部是插件,而且全部可替换。“没有特权核心可以打补丁”,扩展 Harness 就是把一个插件挂载到其他插件旁边。

底层是一个叫 Cordis 的微内核元框架(源自北大与 DeepSeek 研究者的文《A Programming Paradigm for Spatiotemporal Composability》——“时空可组合的编程范式”)。Cordis 只做三件事:插件的加载、卸载、依赖管理

用大白话翻译"时空可组合":

  • 时间维度:插件可以在程序运行时热插拔——不用重启就能装一个新能力;卸载时还能"时光倒流",把这个插件产生的所有副作用(注册的函数、占用的内存、事件监听)干净地回滚掉,不打扰其他插件。这套机制已经在聊天机器人框架 Koishi 上实战了四年。

  • 空间维度:插件之间像乐高积木,通过"服务"和"事件"两种标准接口互相咬合,谁也不依赖谁的具体实现。

另一个核心原理是全程可追溯:模型看到的一切——系统提示词、推理过程、工具调用、子 Agent 调度、每一次上下文注入——都写入一条只追加(append-only)的会话日志。恢复、分叉、检索、回放,全部操作这同一条事件流。 这相当于给 Agent 装了一个"黑匣子",任何一步都能倒带重放。

3.2 Claude Code:上下文工程的极致

Claude Code 的原理可以概括为一个信念:“Agent 看不到的信息等于不存在”,Context 不是越大越好,而是越干净越好

它的三大支柱是:

  1. 上下文工程(Context Engineering):把上下文窗口当作稀缺资源主动管理。对话到 50% 容量就自动压缩(用摘要替换原始轮次);重型探索任务派给子 Agent——子 Agent 有独立的消息历史、独立的压缩机制、独立的 Token 预算,干完活只把摘要返回给主 Agent,噪音绝不污染主线。

  2. 架构约束:精细的权限模型(多种模式 + 多级规则)、工具 Schema 验证、只读工具并发 / 写入工具串行的分区执行算法。

  3. 熵管理:死代码检测、文档一致性、回归检测,对抗系统长期运行后的"老化"。

2026 年它又进化出 Dynamic Workflows(动态工作流):Claude 能根据当前任务,现场写一段 JavaScript 来编排几十上百个子 Agent——指定每个子 Agent 用什么模型、是否在独立 worktree 里干活、中断后如何恢复。以前是开发者在 Claude Code 之上手写 Harness,现在是 Claude Code 现场给自己写 Harness

3.3 Codex:一个内核,两副躯壳

Codex 的原理是**“共享内核 + 双执行形态”**:同一个 Rust 内核(行动循环、模型交互、补丁调度、会话管理只此一份),长出两副躯壳:

  • 本地形态(CLI / IDE 插件):同步实时结对,人全程在循环里,每一步可审批;

  • 云端形态(Codex Cloud):把任务委派到托管的隔离容器,异步跑完自动开 PR,人只在收尾时回来 review。

它最有特色的原理是**“沙箱 × 审批"双轴正交**:别人用"一档自治程度"描述 Agent 能干什么,Codex 用两根独立的轴——沙箱模式(只读 / 工作区可写 / 完全访问)× 审批策略(不信任就问 / 按需 / 永不等)。而且沙箱是操作系统内核级的(macOS Seatbelt、Linux Landlock + seccomp + no_new_privs),不是应用层"自觉”——因为应用层的自觉挡不住派生子进程。

云端形态还有一个精巧设计:setup 阶段有网有密钥,agent 阶段断网抹密钥——装依赖时联网,干活时切断网络。这是对抗提示注入的结构性护栏。

原理层面的大白话总结

| | 它的核心信念

DSH

“没有什么是不能换的”——包括我自己

| | Claude Code |

“上下文是稀缺资源,干净比大重要”

| | Codex |

“自治程度不该是一维的,隔离必须比应用更底层”

|


四、架构对比:拆开看构造

4.1 DeepSeek Harness:微内核 + 插件星系

DSH 的架构是教科书式的微内核设计。运行中的 Harness 本质上就是一个 Cordis Context,所有能力包向 Context 注册服务、事件和能力,最后由一份 cordis.yml 配置文件把它们组装成一台可运行的 Agent:

<span leaf="">packages/core/ &nbsp; &nbsp; &nbsp;← 准核心:Session、System Prompt、Tools、Agent、Agent Loop(也是插件!)</span>

同一套代码,换配置就是不同产品:加终端 UI 插件是 CLI 编程助手,换 Web 插件是浏览器应用,换 Headless 入口是自动化服务,换 ACP/JSON-RPC 前门可以被别的程序驱动。

内置四种预置模式:

| 模式

|

内容

|

场景

Standard

完整编程 Agent:文件、Shell、搜索、Skills、计划、子 Agent、工作流

|

日常使用

| | Code(PTC) |

工具不直接暴露给模型,而是生成 TypeScript SDK,让模型写程序编排——原本 5 轮往返的工具调用压缩成 1 次

|

复杂任务编排

| | Minimal |

只有 bash + 文件编辑器两个工具

|

模型基准测试

| | Creator |

Standard 全家桶 + 运行时检查 + 内存中试验插件

|

造你自己的 Agent

|

4.2 Claude Code:单体精品 + 动态自我编排

架构上 Claude Code 是一个高度打磨的"单体":Async Generator 驱动的无限 Agent Loop(流式产出每个中间事件)、单一 State 对象维护伪不可变语义、7+ 个错误恢复站点、渐进式四级压缩管道、工具分区并发执行。 闭源,但通过 MCP 协议、Hooks(六种事件)、Skills(.claude/skills 目录)、Subagents、Agent Teams 向外开放扩展点。

打个比方:DSH 是积木箱,Claude Code 是一台精密的瑞士手表——你不能换它的齿轮,但它在表盘、表带、表冠上给了你标准化的接口。

4.3 Codex:Rust 单体内核 + 双形态部署

一个 codex-rs 仓库里:core 内核、tui 全屏终端、exec 无头模式(嵌进 CI)、独立的 linux-sandbox helper 二进制。 扩展方式:MCP 双向(既当客户端接外部工具,也能把自己暴露成 MCP server 被别的 Agent 调用)、AGENTS.md 项目指令、Hooks。架构上它比 Claude Code 更"硬核工程"(内核级沙箱、Rust 重写换长程稳定性),但扩展哲学同样是"成品 + 接口",而非"全插件化"。


五、用户使用方式对比

| 维度

|

DeepSeek Harness

|

Claude Code

|

OpenAI Codex

安装

需装 Node.js,然后 npx @deepseek-ai/dsh web

| npm install -g @anthropic-ai/claude-code

,单二进制开箱即用

| npm install -g @openai/codex | | 默认界面 |

Web UI(127.0.0.1:3080),也可换 TUI/Headless

|

终端 CLI + VS Code/JetBrains/Vim/Emacs + 桌面 App

|

终端 CLI + IDE 插件 + Web + App + Cloud

| | 交互风格 |

取决于你装什么插件,可塑性强

|

交互协作型:“先商后做”,每步确认

|

自主代理型:“先做后审”,也可调审批级别

| | 配置方式 | cordis.yml

 组装插件(有学习成本,覆盖是整体替换而非深度合并,新手易踩坑)

| CLAUDE.md

 项目记忆 + 设置层级

| AGENTS.md

(已成开放标准)+ config.toml

| | 上手门槛 |

高——面向"造 Agent 的人"

|

低——面向"用 Agent 的人"

|

低——同上

|

社区里有个很精准的批评:DSH 的"一切皆插件"对开发者是卖点,对普通用户却意味着配置复杂度——一个只想要 AI 编程助手的人,不该被迫理解 Profile 组合和 Bundle 接线。Claude Code 和 Codex 都在拼命走向用户(一次安装、零配置、开箱即用),而 DSH 第一天就把 49 个包摆在你面前让你自己组装。


六、使用场景对比

选 DeepSeek Harness 的场景:

  • 你要自己的 Agent 产品(垂直行业 Agent、企业内部 Agent 平台),不想从轮子造起;

  • 你要做模型/Agent 的评测研究(Minimal 模式专为基准测试设计);

  • 你要自由换模型——官方文档覆盖 DeepSeek 之外的其他供应商和自定义 OpenAI 兼容端点,模型适配器是可替换插件;

  • 你在意数据主权与可审计:MIT 开源、会话全程可追溯回放、可完全私有化部署;

  • 预算敏感:框架免费,只付模型 API 费。

选 Claude Code 的场景:

  • 模糊 Bug 定位、陌生大代码库探索、跨文件复杂重构、架构方案评估——深度推理最强(SWE-Bench Verified 80.8%,但单任务 Token 消耗约为 Codex 的 4 倍);

  • 需要人在循环里实时交互、逐步批准的场景;重度 MCP 生态用户。

选 Codex 的场景:

  • 验收标准明确的功能实现、测试补全、重复性迁移——Token 效率高;

  • 多个独立任务并行、丢到云端异步跑(关电脑也行,跑完开 PR);

  • 需要内核级沙箱安全保证的企业环境;CI 流水线里嵌入无头 Agent。

一线团队的务实答案:很多团队是"两个都装,按任务切换"——Claude Code 处理需要思考的任务,Codex 处理需要苦力的任务。 DSH 则要等它成熟后,才进入"日常使用"的候选名单。


七、可拓展性对比

| 维度

|

DeepSeek Harness

|

Claude Code

|

Codex

扩展粒度 任意层

:模型/工具/技能/会话/沙箱/存储/Loop/调度/UI 全可换

|

接口层:MCP、Hooks、Skills、Subagents

|

接口层:MCP(双向)、Hooks、AGENTS.md

| | 能否换核心(Agent Loop) |

✅ 能,Loop 本身是插件

|

❌ 不能

|

❌ 不能(但开源可 Fork 改源码)

| | 能否换模型 |

✅ 原生设计

|

❌ 绑定 Claude

|

❌ 绑定 GPT

| | 热插拔 |

✅ 运行时挂载/卸载,副作用可回滚

|

|

| | 生态机制 | dsh-plugin

 主题标记发现插件,开源数小时内 33k Stars、约 300 个社区插件涌现

|

MCP 生态最成熟

|

MCP 生态快速追赶

| | 开源可审计 |

✅ MIT

|

❌ 闭源

|

✅ Apache 2.0

|

DSH 在可拓展性上是数量级的差异:别人给你"接口",它给你"换心脏的权利"。但硬币的另一面是插件生态的经典陷阱——插件冲突、版本不兼容、治理缺失。VS Code、Obsidian、Webpack 都经历过"生态繁荣→兼容性噩梦"的周期,而 Cordis 插件共享同一进程、同一 Context、同一工具注册表,运行时隔离还需要时间打磨。


八、关键问题:这是颠覆性变革吗?

先给判断:DSH 可能是一次"产业分工层面"的颠覆,但不是"用户体验层面"的颠覆——至少今天不是。

“Agent 界的安卓"这个类比成立吗?

基本成立,而且比表面看起来更精确:

| 类比项

|

安卓

|

DeepSeek Harness

开源免费,厂商可自由定制

|

AOSP

|

MIT 协议,一切可替换

| |

上层硬件(=模型)可换

|

高通/联发科/三星

|

DeepSeek/Claude/GPT/本地 vLLM

| |

靠生态规模取胜

|

Google Play

| dsh-plugin

 插件生态

| |

碎片化与兼容性风险

|

安卓碎片化经典难题

|

49 包依赖图、插件冲突风险

| |

体验初期不如闭源对手

|

早期安卓 vs iPhone

|

预览版 vs Claude Code 的打磨

|

颠覆性体现在哪三个层面?

1. 把 Harness 从护城河变成公共品。 Claude Code 的成功让全行业看清:模型趋同后,Harness 才是产品力的来源,于是每家都把 Harness 当核心机密。DeepSeek 反其道而行——把自家 Harness 整套开源。这延续了它"模型层开源换生态"的打法(R1 曾用 5.7 天破 2 万 Star,DSH 只用约 1.5 小时破 2.4 万,创下 GitHub 史上最快涨星纪录)。 如果"模型开源"的故事在"Harness 层"重演一遍,闭源 Agent 产品的溢价逻辑会被侵蚀。

2. “模型与 Harness 共同进化"的研发范式。 DeepSeek 从 2026 年 5 月组建 Harness 团队时就把"与模型训练团队深度沟通、实现共同进化、以内部真实任务为反馈源"写进岗位描述。 这意味着未来 DeepSeek 的模型会原生为这套 Harness 优化(类似苹果芯片与 iOS 的协同——讽刺的是,开源的打法内核是垂直整合的思路)。

3. “自进化软件"的雏形。 内测用户发现:DSH 的 Agent 可以检查自己的运行时,发现自己缺某个能力时,现场编写并挂载插件,然后在后续任务中直接调用——“假设某个功能没有,你和 Agent 聊两句,这个功能就做好了”。虽然目前动态插件重启即消失、仍属实验性质,但这指向了一个新物种:软件自己长出新器官

但有三盆冷水

  1. 预览版现实:官方自己警告"会有破坏性变更”,生产环境不可用;企业要的稳定、LTS、SLA 都还没有。

  2. 插件悖论:历史上每个插件生态都走过"先繁荣后治理噩梦"的路;普通用户要的是"零配置开箱即用”,不是"49 个包自己组装”。

  3. Harness 的价值依赖模型:安卓再开放,也要有芯片。DSH 的天花板仍然取决于顶级模型的可及性——如果最强模型始终闭源且不给第三方 Harness 最好的待遇,开源 Harness 的体验上限就受制于人。

最终判断

DSH 之于 Claude Code,不是"更好的产品",而是"不同的物种"。 它赌的是:当 Agent 像当年的 App 一样爆发时,世界需要一个开放的、不被任何单一厂商锁定的运行时底座。如果赌赢了,它确实可能成为"Agent 界的安卓";但安卓也花了五年才追平 iPhone 的体验——DSH 的 2026 年 8 月,只是这个故事的第一页。


附:术语速查

  • Harness:模型之外的一切工程系统(马具比喻)。

  • Agent Loop:接收输入→调用模型→执行工具→反馈结果→循环直到完成。

  • Cordis:DSH 的插件微内核,负责插件热加载/卸载/依赖管理,源自 Koishi 项目的四年实战。

  • PTC / Code 模式:让模型写程序来编排工具调用,减少往返轮次。

  • Append-only 会话日志:只增不改的事件流,支撑恢复/分叉/回放。

  • AGENTS.md / CLAUDE.md:就近生效的项目级 Agent 指令文件。

  • MCP:Model Context Protocol,跨厂商的工具接入协议,三家都支持。