DeepSeek Harness vs Claude Code vs Codex:Agent 三大流派深度对比
报告日期:2026 年 8 月 14 日。DeepSeek Harness 于 2026 年 8 月 13 日刚刚开源,本报告基于其开发者预览版及 Claude Code、Codex 的公开资料撰写。
〇、先给结论(太长不看版)
三者的关系不是同一层级的竞争:
-
Claude Code 和 Codex 是"成品手机"——厂商把模型和外壳(Harness)深度整合,开箱即用,追求的是普通开发者的极致体验;
-
DeepSeek Harness(dsh) 是"手机操作系统"——它不是要给你一部手机,而是要把"造手机的全套图纸"开源,让任何人都能拼出自己的 Agent。
用大白话说:Claude Code 像 iPhone(闭源、垂直整合、体验打磨到极致),DeepSeek Harness 像安卓(开源、可拆解、靠生态取胜),Codex 介于两者之间——开源但交付的是成品,更像"开源版的一加手机"。
至于"颠覆性变革":DSH 的颠覆性不在当下体验,而在产业分工——它试图把 Harness 从各家的"护城河"变成"公共基础设施"。这个判断的详细论证见文末第八节。
一、先把概念说清楚:什么是 Harness?
“Harness"原意是马具、缰绳。在 AI 圈的语境下,DeepSeek 给出的定义最直白:
除模型本身以外,其他一切都是 Harness。 核心公式:Model + Harness = Agent。
用大白话解释:大模型是一匹千里马,力气大、跑得快,但它不会自己认路、不会自己拿东西、也不会自己停下来。Harness 就是马鞍、缰绳、马蹄铁、骑手——让模型在真实世界里"干活"的全套工程系统。它包括:上下文管理、工具调用、任务规划、文件读写、代码执行、权限控制、记忆、重试机制等等。
为什么这个概念在 2026 年突然火了?因为行业共识变了:模型能力已经趋同,真正拉开差距的是"工程外壳”。AI 编程早就过了"模型会不会写代码"的阶段,真正难的是模型能不能在真实代码库里稳定干活——组织上下文、控制迭代次数、把测试失败和日志重新喂回模型。这个"思考→行动→反馈→修正"的长循环能不能跑稳,全靠 Harness。
二、三者定位对比:一张总表
| 维度
|
DeepSeek Harness (dsh)
|
Claude Code
|
OpenAI Codex
| 本质定位 |
开源 Agent 运行时框架/底座
|
闭源商业成品编程 Agent
|
开源的成品编程 Agent(内核 + 双形态)
| | 一句话 |
“一切皆插件"的 Agent 操作系统
|
“技术合伙人”,交互式深度协作
|
“执行团队”,本地结对 + 云端委派
| | 厂商 |
DeepSeek(幻方)
|
Anthropic
|
OpenAI
| | 开源协议 |
MIT(完全开源)
|
闭源(二进制分发)
|
Apache 2.0(完全开源)
| | 技术栈 |
Node.js / TypeScript,Cordis 微内核
|
TypeScript
|
Rust(2025 年重写,启动快、长程稳定)
| | 绑定模型 |
不绑定,模型适配器本身也是插件
|
深度绑定 Claude 系列
|
深度绑定 GPT 系列
| | 成熟度 |
开发者预览版(2026-08-13 开源),明确警告"会有破坏性变更”
|
成熟商业产品,年收入据报 25 亿美元量级
|
成熟商业产品,GitHub 80k+ Stars
| | 价格 |
框架免费,只付模型调用费
|
订阅制(Pro $20 / Max $100 月起)
|
订阅制(Plus $20 起,含 ChatGPT)
|
关键区分:Claude Code 和 Codex 是面向终端用户的成品应用;DeepSeek Harness 更偏向底座框架,强调每一层都能被开发者替换和重组,默认自带的 Web UI 与工具集只是其中一种组合方式。
三、原理对比:三家的"世界观"差异
3.1 DeepSeek Harness:一切皆插件(Everything is a Plugin)
DSH 的核心原理激进到近乎执拗:模型适配器、工具注册表、会话日志、甚至 Agent Loop 本身,全部是插件,而且全部可替换。“没有特权核心可以打补丁”,扩展 Harness 就是把一个插件挂载到其他插件旁边。
底层是一个叫 Cordis 的微内核元框架(源自北大与 DeepSeek 研究者的文《A Programming Paradigm for Spatiotemporal Composability》——“时空可组合的编程范式”)。Cordis 只做三件事:插件的加载、卸载、依赖管理。
用大白话翻译"时空可组合":
-
时间维度:插件可以在程序运行时热插拔——不用重启就能装一个新能力;卸载时还能"时光倒流",把这个插件产生的所有副作用(注册的函数、占用的内存、事件监听)干净地回滚掉,不打扰其他插件。这套机制已经在聊天机器人框架 Koishi 上实战了四年。
-
空间维度:插件之间像乐高积木,通过"服务"和"事件"两种标准接口互相咬合,谁也不依赖谁的具体实现。
另一个核心原理是全程可追溯:模型看到的一切——系统提示词、推理过程、工具调用、子 Agent 调度、每一次上下文注入——都写入一条只追加(append-only)的会话日志。恢复、分叉、检索、回放,全部操作这同一条事件流。 这相当于给 Agent 装了一个"黑匣子",任何一步都能倒带重放。
3.2 Claude Code:上下文工程的极致
Claude Code 的原理可以概括为一个信念:“Agent 看不到的信息等于不存在”,Context 不是越大越好,而是越干净越好。
它的三大支柱是:
-
上下文工程(Context Engineering):把上下文窗口当作稀缺资源主动管理。对话到 50% 容量就自动压缩(用摘要替换原始轮次);重型探索任务派给子 Agent——子 Agent 有独立的消息历史、独立的压缩机制、独立的 Token 预算,干完活只把摘要返回给主 Agent,噪音绝不污染主线。
-
架构约束:精细的权限模型(多种模式 + 多级规则)、工具 Schema 验证、只读工具并发 / 写入工具串行的分区执行算法。
-
熵管理:死代码检测、文档一致性、回归检测,对抗系统长期运行后的"老化"。
2026 年它又进化出 Dynamic Workflows(动态工作流):Claude 能根据当前任务,现场写一段 JavaScript 来编排几十上百个子 Agent——指定每个子 Agent 用什么模型、是否在独立 worktree 里干活、中断后如何恢复。以前是开发者在 Claude Code 之上手写 Harness,现在是 Claude Code 现场给自己写 Harness。
3.3 Codex:一个内核,两副躯壳
Codex 的原理是**“共享内核 + 双执行形态”**:同一个 Rust 内核(行动循环、模型交互、补丁调度、会话管理只此一份),长出两副躯壳:
-
本地形态(CLI / IDE 插件):同步实时结对,人全程在循环里,每一步可审批;
-
云端形态(Codex Cloud):把任务委派到托管的隔离容器,异步跑完自动开 PR,人只在收尾时回来 review。
它最有特色的原理是**“沙箱 × 审批"双轴正交**:别人用"一档自治程度"描述 Agent 能干什么,Codex 用两根独立的轴——沙箱模式(只读 / 工作区可写 / 完全访问)× 审批策略(不信任就问 / 按需 / 永不等)。而且沙箱是操作系统内核级的(macOS Seatbelt、Linux Landlock + seccomp + no_new_privs),不是应用层"自觉”——因为应用层的自觉挡不住派生子进程。
云端形态还有一个精巧设计:setup 阶段有网有密钥,agent 阶段断网抹密钥——装依赖时联网,干活时切断网络。这是对抗提示注入的结构性护栏。
原理层面的大白话总结
| | 它的核心信念
| DSH |
“没有什么是不能换的”——包括我自己
| | Claude Code |
“上下文是稀缺资源,干净比大重要”
| | Codex |
“自治程度不该是一维的,隔离必须比应用更底层”
|
四、架构对比:拆开看构造
4.1 DeepSeek Harness:微内核 + 插件星系
DSH 的架构是教科书式的微内核设计。运行中的 Harness 本质上就是一个 Cordis Context,所有能力包向 Context 注册服务、事件和能力,最后由一份 cordis.yml 配置文件把它们组装成一台可运行的 Agent:
<span leaf="">packages/core/ ← 准核心:Session、System Prompt、Tools、Agent、Agent Loop(也是插件!)</span>
同一套代码,换配置就是不同产品:加终端 UI 插件是 CLI 编程助手,换 Web 插件是浏览器应用,换 Headless 入口是自动化服务,换 ACP/JSON-RPC 前门可以被别的程序驱动。
内置四种预置模式:
| 模式
|
内容
|
场景
| Standard |
完整编程 Agent:文件、Shell、搜索、Skills、计划、子 Agent、工作流
|
日常使用
| | Code(PTC) |
工具不直接暴露给模型,而是生成 TypeScript SDK,让模型写程序编排——原本 5 轮往返的工具调用压缩成 1 次
|
复杂任务编排
| | Minimal |
只有 bash + 文件编辑器两个工具
|
模型基准测试
| | Creator |
Standard 全家桶 + 运行时检查 + 内存中试验插件
|
造你自己的 Agent
|
4.2 Claude Code:单体精品 + 动态自我编排
架构上 Claude Code 是一个高度打磨的"单体":Async Generator 驱动的无限 Agent Loop(流式产出每个中间事件)、单一 State 对象维护伪不可变语义、7+ 个错误恢复站点、渐进式四级压缩管道、工具分区并发执行。 闭源,但通过 MCP 协议、Hooks(六种事件)、Skills(.claude/skills 目录)、Subagents、Agent Teams 向外开放扩展点。
打个比方:DSH 是积木箱,Claude Code 是一台精密的瑞士手表——你不能换它的齿轮,但它在表盘、表带、表冠上给了你标准化的接口。
4.3 Codex:Rust 单体内核 + 双形态部署
一个 codex-rs 仓库里:core 内核、tui 全屏终端、exec 无头模式(嵌进 CI)、独立的 linux-sandbox helper 二进制。 扩展方式:MCP 双向(既当客户端接外部工具,也能把自己暴露成 MCP server 被别的 Agent 调用)、AGENTS.md 项目指令、Hooks。架构上它比 Claude Code 更"硬核工程"(内核级沙箱、Rust 重写换长程稳定性),但扩展哲学同样是"成品 + 接口",而非"全插件化"。
五、用户使用方式对比
| 维度
|
DeepSeek Harness
|
Claude Code
|
OpenAI Codex
| 安装 |
需装 Node.js,然后 npx @deepseek-ai/dsh web
| npm install -g @anthropic-ai/claude-code
,单二进制开箱即用
| npm install -g @openai/codex |
| 默认界面 |
Web UI(127.0.0.1:3080),也可换 TUI/Headless
|
终端 CLI + VS Code/JetBrains/Vim/Emacs + 桌面 App
|
终端 CLI + IDE 插件 + Web + App + Cloud
| | 交互风格 |
取决于你装什么插件,可塑性强
|
交互协作型:“先商后做”,每步确认
|
自主代理型:“先做后审”,也可调审批级别
|
| 配置方式 | cordis.yml
组装插件(有学习成本,覆盖是整体替换而非深度合并,新手易踩坑)
| CLAUDE.md
项目记忆 + 设置层级
| AGENTS.md
(已成开放标准)+ config.toml
| | 上手门槛 |
高——面向"造 Agent 的人"
|
低——面向"用 Agent 的人"
|
低——同上
|
社区里有个很精准的批评:DSH 的"一切皆插件"对开发者是卖点,对普通用户却意味着配置复杂度——一个只想要 AI 编程助手的人,不该被迫理解 Profile 组合和 Bundle 接线。Claude Code 和 Codex 都在拼命走向用户(一次安装、零配置、开箱即用),而 DSH 第一天就把 49 个包摆在你面前让你自己组装。
六、使用场景对比
选 DeepSeek Harness 的场景:
-
你要造自己的 Agent 产品(垂直行业 Agent、企业内部 Agent 平台),不想从轮子造起;
-
你要做模型/Agent 的评测研究(Minimal 模式专为基准测试设计);
-
你要自由换模型——官方文档覆盖 DeepSeek 之外的其他供应商和自定义 OpenAI 兼容端点,模型适配器是可替换插件;
-
你在意数据主权与可审计:MIT 开源、会话全程可追溯回放、可完全私有化部署;
-
预算敏感:框架免费,只付模型 API 费。
选 Claude Code 的场景:
-
模糊 Bug 定位、陌生大代码库探索、跨文件复杂重构、架构方案评估——深度推理最强(SWE-Bench Verified 80.8%,但单任务 Token 消耗约为 Codex 的 4 倍);
-
需要人在循环里实时交互、逐步批准的场景;重度 MCP 生态用户。
选 Codex 的场景:
-
验收标准明确的功能实现、测试补全、重复性迁移——Token 效率高;
-
多个独立任务并行、丢到云端异步跑(关电脑也行,跑完开 PR);
-
需要内核级沙箱安全保证的企业环境;CI 流水线里嵌入无头 Agent。
一线团队的务实答案:很多团队是"两个都装,按任务切换"——Claude Code 处理需要思考的任务,Codex 处理需要苦力的任务。 DSH 则要等它成熟后,才进入"日常使用"的候选名单。
七、可拓展性对比
| 维度
|
DeepSeek Harness
|
Claude Code
|
Codex
| 扩展粒度 | 任意层 |
:模型/工具/技能/会话/沙箱/存储/Loop/调度/UI 全可换
|
接口层:MCP、Hooks、Skills、Subagents
|
接口层:MCP(双向)、Hooks、AGENTS.md
| | 能否换核心(Agent Loop) |
✅ 能,Loop 本身是插件
|
❌ 不能
|
❌ 不能(但开源可 Fork 改源码)
| | 能否换模型 |
✅ 原生设计
|
❌ 绑定 Claude
|
❌ 绑定 GPT
| | 热插拔 |
✅ 运行时挂载/卸载,副作用可回滚
|
❌
|
❌
|
| 生态机制 | dsh-plugin
主题标记发现插件,开源数小时内 33k Stars、约 300 个社区插件涌现
|
MCP 生态最成熟
|
MCP 生态快速追赶
| | 开源可审计 |
✅ MIT
|
❌ 闭源
|
✅ Apache 2.0
|
DSH 在可拓展性上是数量级的差异:别人给你"接口",它给你"换心脏的权利"。但硬币的另一面是插件生态的经典陷阱——插件冲突、版本不兼容、治理缺失。VS Code、Obsidian、Webpack 都经历过"生态繁荣→兼容性噩梦"的周期,而 Cordis 插件共享同一进程、同一 Context、同一工具注册表,运行时隔离还需要时间打磨。
八、关键问题:这是颠覆性变革吗?
先给判断:DSH 可能是一次"产业分工层面"的颠覆,但不是"用户体验层面"的颠覆——至少今天不是。
“Agent 界的安卓"这个类比成立吗?
基本成立,而且比表面看起来更精确:
| 类比项
|
安卓
|
DeepSeek Harness
开源免费,厂商可自由定制
|
AOSP
|
MIT 协议,一切可替换
| |
上层硬件(=模型)可换
|
高通/联发科/三星
|
DeepSeek/Claude/GPT/本地 vLLM
| |
靠生态规模取胜
|
Google Play
| dsh-plugin
插件生态
| |
碎片化与兼容性风险
|
安卓碎片化经典难题
|
49 包依赖图、插件冲突风险
| |
体验初期不如闭源对手
|
早期安卓 vs iPhone
|
预览版 vs Claude Code 的打磨
|
颠覆性体现在哪三个层面?
1. 把 Harness 从护城河变成公共品。 Claude Code 的成功让全行业看清:模型趋同后,Harness 才是产品力的来源,于是每家都把 Harness 当核心机密。DeepSeek 反其道而行——把自家 Harness 整套开源。这延续了它"模型层开源换生态"的打法(R1 曾用 5.7 天破 2 万 Star,DSH 只用约 1.5 小时破 2.4 万,创下 GitHub 史上最快涨星纪录)。 如果"模型开源"的故事在"Harness 层"重演一遍,闭源 Agent 产品的溢价逻辑会被侵蚀。
2. “模型与 Harness 共同进化"的研发范式。 DeepSeek 从 2026 年 5 月组建 Harness 团队时就把"与模型训练团队深度沟通、实现共同进化、以内部真实任务为反馈源"写进岗位描述。 这意味着未来 DeepSeek 的模型会原生为这套 Harness 优化(类似苹果芯片与 iOS 的协同——讽刺的是,开源的打法内核是垂直整合的思路)。
3. “自进化软件"的雏形。 内测用户发现:DSH 的 Agent 可以检查自己的运行时,发现自己缺某个能力时,现场编写并挂载插件,然后在后续任务中直接调用——“假设某个功能没有,你和 Agent 聊两句,这个功能就做好了”。虽然目前动态插件重启即消失、仍属实验性质,但这指向了一个新物种:软件自己长出新器官。
但有三盆冷水
-
预览版现实:官方自己警告"会有破坏性变更”,生产环境不可用;企业要的稳定、LTS、SLA 都还没有。
-
插件悖论:历史上每个插件生态都走过"先繁荣后治理噩梦"的路;普通用户要的是"零配置开箱即用”,不是"49 个包自己组装”。
-
Harness 的价值依赖模型:安卓再开放,也要有芯片。DSH 的天花板仍然取决于顶级模型的可及性——如果最强模型始终闭源且不给第三方 Harness 最好的待遇,开源 Harness 的体验上限就受制于人。
最终判断
DSH 之于 Claude Code,不是"更好的产品",而是"不同的物种"。 它赌的是:当 Agent 像当年的 App 一样爆发时,世界需要一个开放的、不被任何单一厂商锁定的运行时底座。如果赌赢了,它确实可能成为"Agent 界的安卓";但安卓也花了五年才追平 iPhone 的体验——DSH 的 2026 年 8 月,只是这个故事的第一页。
附:术语速查
-
Harness:模型之外的一切工程系统(马具比喻)。
-
Agent Loop:接收输入→调用模型→执行工具→反馈结果→循环直到完成。
-
Cordis:DSH 的插件微内核,负责插件热加载/卸载/依赖管理,源自 Koishi 项目的四年实战。
-
PTC / Code 模式:让模型写程序来编排工具调用,减少往返轮次。
-
Append-only 会话日志:只增不改的事件流,支撑恢复/分叉/回放。
-
AGENTS.md / CLAUDE.md:就近生效的项目级 Agent 指令文件。
-
MCP:Model Context Protocol,跨厂商的工具接入协议,三家都支持。
- 原文作者:知识铺
- 原文链接:https://index.zshipu.com/ai002/post/20260815/DeepSeek-Harness-vs-Claude-Code-vs-CodexAgent-%E4%B8%89%E5%A4%A7%E6%B5%81%E6%B4%BE%E6%B7%B1%E5%BA%A6%E5%AF%B9%E6%AF%94/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。
- 免责声明:本页面内容均来源于站内编辑发布,部分信息来源互联网,并不意味着本站赞同其观点或者证实其内容的真实性,如涉及版权等问题,请立即联系客服进行更改或删除,保证您的合法权益。转载请注明来源,欢迎对文章中的引用来源进行考证,欢迎指出任何有错误或不够清晰的表达。也可以邮件至 sblig@126.com