DeepSeek Harness 深度评测:Agent 时代的「安卓」还是开发者的一次豪赌?
综合 10+ 信源实测:架构哲学、四种模式、与 Claude Code/Codex 正面交锋、插件生态、安全模型、社区争议与独立判断。

评分综合 12+ 信源实测,反映“框架价值”而非“成品易用度”。
一句话结论
DeepSeek Harness(dsh)不是又一个编码 Agent,而是「造 Agent 的框架」——它以“一切皆插件”的 Cordis 微内核,把模型适配器、工具、会话、沙箱、乃至 Agent 循环本身全部变成可替换的插件。发布一周 GitHub 星数冲到 18.5 万,创下 Agent 类项目纪录。但它是 MIT 开源的开发者预览版,官方用大写字母警告“将发生破坏性变更”。它是 Agent 时代的「安卓」,但目前是一台让你亲手攒的安卓机,不是开箱即用的 iPhone。
适合谁
想理解/改造 Agent 运行时的开发者 · 要造内部 Agent 产品的团队 · 拒绝模型锁定的团队 · 需要可审计自动化流程的团队
不适合谁
要开箱即用的普通用户 · 生产关键路径 · 追求稳定性的企业(无合规认证 + 破坏性变更预警)
一、它到底是什么:先纠正三个误解
| 误解 | 真相 |
|---|---|
| “它是新的 DeepSeek 模型” | ❌ 不是模型,是 Agent 运行时框架(SDK + 应用) |
| “它是便宜版 Claude Code” | ❌ 定位完全不同:Claude Code 是成品,它是“组装 Agent 的积木” |
| “它是又一个开源编码工具” | ❌ 它重新定义了扩展边界——连 Agent 循环本身都是插件 |
核心架构:基于 Cordis 微内核(北大与 DeepSeek 联合论文)。内核只负责插件的加载、依赖解析与事件调度,业务逻辑为零。模型适配器、工具注册表、会话日志、Agent 循环、UI——每一个组件都是独立的 Cordis 插件,通过 ctx.plugin() 挂载,通过 YAML 配置自由组合,卸载时副作用自动撤销。
对比:Claude Code / Codex 是 Rust 单体核心 + 外部挂件(hooks、MCP、skills 挂在外面,你碰不到主干)。dsh 则把主干也拆给你了——这是开源哲学与闭源哲学的正面交锋(知乎作者:“Agent 时代的安卓 vs iPhone”)。
这一架构带来三个实打实的差异:
- 可审计:运行中的 dsh 是一棵插件树,每个注册项都能追溯来源
- 可替换:换模型、换 UI、换沙箱策略 = 改配置,不是 fork 源码
- 可自我演化:创造模式下,模型可以自己写插件、自己装上(社区称“剑指自进化”)
二、上手实测:门槛确实低,但坑不少
安装(三选一)
# 最快:npx 启动(推荐)
npx @deepseek-ai/dsh web
# 源码安装
git clone https://github.com/deepseek-ai/deepseek-harness
cd deepseek-harness && pnpm install && pnpm run build && pnpm dsh web
# 无头模式(适合 CI)
dsh --profile headless "任务描述"
启动后浏览器打开 http://127.0.0.1:3080,三步配置:填模型 API Key → 选工作目录 → 开始干活。
实测数据点(综合多信源)
| 项目 | 数据 | 来源 |
|---|---|---|
| 安装体量 | npm 装 531 包约 306 MB(非流传的 1.5GB,那是源码构建) | atlascloud |
| 内存占用 | 空闲 35-40 MB,启动峰值约 212 MB | atlascloud |
| 88 页论文翻译 | 22 分钟,缓存命中率 98%,10 个子代理并行 | 智东西 |
| 贪吃蛇游戏 | 极简模式 50 秒,PTC 模式 65 秒 | 智东西 |
| 内容质检任务 | 标准模式 43 秒 / 5 步完成 | 觉醒AI |
| 首 Token 延迟 | 平均 1.4 秒 | 智东西 |
| 指令不明确时 | 主动拉起提问、给出选项(不同于 Codex 的闷头干) | 36氪 |
配置陷阱(实测踩坑,官方文档缺失)
模型条目必须显式声明
compat.thinkingFormat、contextWindow、maxTokens。不声明则继承默认值,同一任务 token 成本可能多耗 3.5 倍、耗时 2.8 倍(36 步 vs 15 步)。这两行 YAML 在官方文档网站上没有——靠 Trajectory 轨迹视图才定位到(atlascloud 实测)。
三、四种模式详解(不是等级,是场景)
| 模式 | 定位 | 工具集 | 适合 |
|---|---|---|---|
| 标准模式 | 功能完整编码 Agent | 文件编辑、Shell、检索、Skills、计划、目标、子代理、工作流 | 绝大多数用户 |
| PTC 模式 | 程序化工具调用 | 标准全部 + Code Mode SDK(模型写 TypeScript 组合多步操作) | 已跑通的重复流程 |
| 极简模式 | 双工具最小环境 | 仅持久 bash + str_replace_editor | 模型基准测试 |
| 创造模式 | 自定义运行时 | 标准全部 + 运行时检查、插件实验、preset 创作(等同 shell 权限) | 高级开发者 |
实测发现:标准模式适合陌生任务探索;PTC 模式不会自动提速——陌生流程反而可能超 2 分钟无输出(觉醒AI),它只适合“步骤已稳定的重复任务”。别把四种模式当升级路线,它们是工具箱。
四、三大亮点:别人没有的
1. Trajectory 轨迹视图 —— 最好的 Agent 调试器
纯追加的 JSONL 事件流,记录模型看到的一切:系统提示词、思维链、工具调用与结果、子代理调度。可以按来源过滤、恢复、分叉、检索、回放。
- 实测价值:诊断配置问题从“几小时”缩到“几分钟”(atlascloud)
- 对比:Claude Code / Codex 没有这种插件级审计轨迹(MindStudio:“这是 AI 可观测性工具该有的能力”)
2. Token 消耗透明 + 高缓存命中
底部实时统计 token 消耗与缓存命中率。实测缓存命中率多在 98-99%,偶尔 100%,长任务成本控制出色。透明到“防止一不留神刷爆信用卡”(36氪)。
3. 权限边界清晰可配置
内置进程沙箱,三种权限模式(只读 / 工作区可写 / 完全访问)。实测越界写文件被沙箱拒绝后弹出权限升级请求(可拒绝或仅允许一次)。对比 Codex 的 OS 内核级沙箱(最安全但最不灵活)和 Claude Code 的应用层钩子(灵活但隔离弱),dsh 走的是“沙箱策略本身是插件”的第三条路。
五、正面交锋:dsh vs Claude Code vs Codex
| 维度 | DeepSeek Harness | Claude Code | OpenAI Codex |
|---|---|---|---|
| 定位 | 开放 Agent 运行时框架 | 成熟商业编码产品 | 成熟产品家族 |
| 开源 | ✅ MIT,全部源码 | ❌ 专有(仅文档) | CLI 部分 Apache-2.0 |
| 模型 | 任意:DeepSeek/OpenAI/Anthropic/OpenRouter + 任意 OpenAI 兼容端点 | 仅 Claude 系 | 主要 OpenAI |
| 沙箱 | 插件化、可自定义 | 应用层钩子 | OS 内核级(最强隔离) |
| 审计 | Trajectory 插件级审计 | 26 个生命周期钩子 | 风险操作前二进制审批 |
| 界面 | 本地 Web UI + headless + Python SDK | 终端/IDE/桌面/移动/浏览器/Slack | CLI/IDE/桌面/云端 |
| MCP | 社区插件(非核心) | 原生一等公民 | 原生 |
| 价格 | 框架免费,仅付模型 API 费 | Pro $20/月起 | 订阅制 |
| 成熟度 | 开发者预览,破坏性变更预警 | 成熟稳定 | 成熟稳定 |
| 所有权负担 | 高:你自己维护插件/兼容/沙箱 | 低 | 低 |
关键判断(综合 5 篇英文深度评测)
- 选 dsh:需要源码审计/可 fork、拒绝模型锁定、要造自己的 Agent 框架、愿意承受破坏性变更(SpringBrand:“dsh 是框架,不是产品”)
- 选 Claude Code:要开箱即用的成品、五端覆盖、企业审批链、可预测计费(apidog:“它是更安全的选择”)
- 选 Codex:要处理不可信外部代码的最强隔离、跨端交接
- 务实路线:很多人两者并行——Claude Code 管生产,dsh 在可丢弃的分支上实验(SpringBrand 建议)
一个被多数评测忽略的事实:dsh 可以通过插件把 Claude Code / Codex 当作子代理调用——它们不是竞争对手,而是 dsh 的一个“工具”。
六、插件生态:机会与风险并存
机会:空白还是蓝海
- GitHub
dsh-plugintopic 已有 900+ 公开插件(官方 + 社区) - 空白很多:如“会话→日报/周报/交接文档”直到 8 月中才有人做(dsh-report-studio 作者)
- 官方内置 100+ 插件,含专为开发设计的 Skill:dsh-code-review(审 PR)、dsh-doc-standards(文档规范)、dsh-find-simplifications(找可简化代码)等
风险:三个必须知道的坑
安装的社区插件与你的 Agent 同进程运行,没有安全审计。几乎所有插件都是发布几天内写的(SpringBrand 警告)。
本地开发时插件的裸导入解析、isolate realm 服务撞名、Bundle 权限过大——实测踩坑记录一大串(插件开发者实战)。
分发靠 npm 包 + dsh plugin add,“插件清单”只是只读投影,没有安装中心。
实战:第一个插件有多难
最小插件只需四个导出(name/inject/Config/apply)+ 一个 defineTool,约 20 行代码。但要做出能发布的产品级插件,要处理:数组入参、结构化输出、并发、取消、输入校验、部署限额、peer 依赖、README 写明平面与 realm——复杂度全在后半段。
七、安全模型与争议点
安全模型:三档沙箱(只读/工作区可写/完全访问)+ 审批弹窗 + 插件化沙箱策略。但对生产环境:
- ❌ 无 SOC 2 / ISO 27001(Anthropic 有)
- ❌ 无安全审计的插件生态
- ⚠️ 创造模式 = shell 权限,等同信任模型执行任意代码
社区争议(小红书高赞帖):
- 👍 “二开真的太爽了”(779 赞)—— 可定制性碾压
- 👎 “恕我直言 DeepSeek Harness 根本不是个 Agent”(95 赞)—— 认为它更多是框架不是产品,普通用户用不上
- 👍 “保姆级入门教程”(1002 赞)—— 学习资源正在快速补齐
真正的争议点:dsh 发布前两小时,DeepSeek V4-Pro 正式版宣布大幅涨价(API 价格约为原来的 3 倍)。这一冷一热形成强烈反差——框架是免费的,但喂它的模型 API 变贵了。VentureBeat 评价:“DeepSeek 同时追逐两个可能冲突的优势:让 Agent 栈更开放,同时让自家 API 更贵。” 对深度用户,缓存命中率高(98%+)+ 离线权重可选,部分抵消了涨价影响。
八、独立判断与结论
它值不值得用?
适合 dsh 的:
- ✅ Agent 开发者 / 研究者:想理解、改造 Agent 运行时的最佳学习对象(“开发者天选的马鞍”)
- ✅ 要造内部 Agent 产品的团队:反正要写 harness,dsh 是现成底板(SpringBrand:“这正是 dsh 设计的场景”)
- ✅ 拒绝模型锁定的团队:一个框架驱动任意模型,dsh 的结构性优势
- ✅ 需要可审计自动化流程:权限边界 + 轨迹视图 + 完全开源
- ✅ 预算敏感的批量自动化:框架免费 + DeepSeek 模型 + 高缓存命中
不适合的:
- ❌ 要开箱即用的普通用户:学习成本高、装插件要懂依赖和 realm
- ❌ 生产关键路径:README 用大写字母承诺“将发生破坏性变更”,别赌
- ❌ 追求稳定性的企业:无合规认证、无成熟支持、配置格式可能下月就变
最终评价
DeepSeek Harness 用“一切皆插件”把过去藏在 Agent 产品内部的运行结构,摆到了每个开发者面前。代价是复杂,回报是可以动手改。 它不是最好的对话工具,也不是成熟的生产平台——它是 Agent 时代最值得研究的“底板”,是一场关于“开源能否驯服 Agent”的豪赌。
一句话选型:想用 Agent → Claude Code/Codex;想造 Agent → dsh;两个都想要 → 并行跑,dsh 放可丢弃的分支上。
社区金句:“闭源为用户提供现在,开源让用户自己掌握未来。”(智东西)——只是记住,掌握未来要自己动手。
编辑手记 · 再想一层
DeepSeek Harness 的价值是「把 Agent 内部结构摆到桌面上」:一切皆插件意味着可审计、可替换、可自我演化——这是它与 Claude Code(单体成品)的哲学对决。但它仍是被官方明确警告「将发生破坏性变更」的开发者预览版:它是学习与自建 Agent 的底板,不是生产依赖。用它请遵循「可丢弃分支实验」原则,无合规认证前别赌关键路径。
评测日期:2026-08-23。本文综合以下信源:智东西《实测DeepSeek Harness》、36氪《深度体验DeepSeek Harness,我原谅它涨价了》、觉醒AI《实测四种模式》、atlascloud《3次运行声称完成,仅1页生效》、实在智能《好用吗?真实体验》、MindStudio《vs Claude Code vs Codex》、VentureBeat、4sAPI《vs Codex vs Claude Code》、apidog《vs Claude Code》、agentpedia《vs Claude Code vs Codex vs Cursor》、SpringBrand《vs Claude Code》、DeepSeek Harness 官方架构文档、GitHub 插件开发实战(dsh-report-studio)。安装体量/内存占用等为本评测独立复核。模型与框架版本可能变动,请以官方为准。
💡 常见问题
DeepSeek Harness 是模型还是工具?
都不是——它是 Agent 运行时框架(SDK + 应用),MIT 开源、Cordis 微内核『一切皆插件』。发布一周星数冲到 18.5 万,但仍是开发者预览版,官方警告将有破坏性变更。
四种模式怎么选?
标准模式适合绝大多数场景;PTC 模式适合『步骤已稳定』的重复流程(不会自动提速);极简模式用于基准测试;创造模式等同 shell 权限,仅高级开发者用。
它能用 Claude Code/Codex 当子代理吗?
可以,通过插件把外部 Agent 作为工具调用——它们不是竞争而是 dsh 的插件。
生产环境能用吗?
目前不建议关键路径使用:无 SOC2/ISO 认证、插件生态无安全审计、创造模式风险高。适合可丢弃分支实验与自建 Agent 的底板。

