深度评测#DeepSeek#Harness#Agent框架#开源

DeepSeek Harness 深度评测:Agent 时代的「安卓」还是开发者的一次豪赌?

综合 10+ 信源实测:架构哲学、四种模式、与 Claude Code/Codex 正面交锋、插件生态、安全模型、社区争议与独立判断。

AIAI评测 编辑部
D
本评测涉及工具
DeepSeek Harness
查看工具 →
DeepSeek Harness 深度评测:Agent 时代的「安卓」还是开发者的一次豪赌? 封面
DeepSeek Harness 综合评分图
AI评测 综合评分8.6/ 10
开源与可定制性4.8
架构设计理念4.5
实际可用性4.0
生态与插件3.5
开箱即用体验3.0
生产就绪度2.5

评分综合 12+ 信源实测,反映“框架价值”而非“成品易用度”。

一句话结论

DeepSeek Harness(dsh)不是又一个编码 Agent,而是「造 Agent 的框架」——它以“一切皆插件”的 Cordis 微内核,把模型适配器、工具、会话、沙箱、乃至 Agent 循环本身全部变成可替换的插件。发布一周 GitHub 星数冲到 18.5 万,创下 Agent 类项目纪录。但它是 MIT 开源的开发者预览版,官方用大写字母警告“将发生破坏性变更”。它是 Agent 时代的「安卓」,但目前是一台让你亲手攒的安卓机,不是开箱即用的 iPhone。

适合谁

不适合谁


一、它到底是什么:先纠正三个误解

核心架构:基于 Cordis 微内核(北大与 DeepSeek 联合论文)。内核只负责插件的加载、依赖解析与事件调度,业务逻辑为零。模型适配器、工具注册表、会话日志、Agent 循环、UI——每一个组件都是独立的 Cordis 插件,通过 ctx.plugin() 挂载,通过 YAML 配置自由组合,卸载时副作用自动撤销。

这一架构带来三个实打实的差异

  1. 可审计:运行中的 dsh 是一棵插件树,每个注册项都能追溯来源
  2. 可替换:换模型、换 UI、换沙箱策略 = 改配置,不是 fork 源码
  3. 可自我演化:创造模式下,模型可以自己写插件、自己装上(社区称“剑指自进化”)

二、上手实测:门槛确实低,但坑不少

安装(三选一)

  
terminal

启动后浏览器打开 http://127.0.0.1:3080,三步配置:填模型 API Key → 选工作目录 → 开始干活。

实测数据点(综合多信源)

配置陷阱(实测踩坑,官方文档缺失)


三、四种模式详解(不是等级,是场景)

实测发现:标准模式适合陌生任务探索;PTC 模式不会自动提速——陌生流程反而可能超 2 分钟无输出(觉醒AI),它只适合“步骤已稳定的重复任务”。别把四种模式当升级路线,它们是工具箱。


四、三大亮点:别人没有的

1. Trajectory 轨迹视图 —— 最好的 Agent 调试器

纯追加的 JSONL 事件流,记录模型看到的一切:系统提示词、思维链、工具调用与结果、子代理调度。可以按来源过滤、恢复、分叉、检索、回放。

  • 实测价值:诊断配置问题从“几小时”缩到“几分钟”(atlascloud)
  • 对比:Claude Code / Codex 没有这种插件级审计轨迹(MindStudio:“这是 AI 可观测性工具该有的能力”)

2. Token 消耗透明 + 高缓存命中

底部实时统计 token 消耗与缓存命中率。实测缓存命中率多在 98-99%,偶尔 100%,长任务成本控制出色。透明到“防止一不留神刷爆信用卡”(36氪)。

3. 权限边界清晰可配置

内置进程沙箱,三种权限模式(只读 / 工作区可写 / 完全访问)。实测越界写文件被沙箱拒绝后弹出权限升级请求(可拒绝或仅允许一次)。对比 Codex 的 OS 内核级沙箱(最安全但最不灵活)和 Claude Code 的应用层钩子(灵活但隔离弱),dsh 走的是“沙箱策略本身是插件”的第三条路。


五、正面交锋:dsh vs Claude Code vs Codex

三大 Agent 工具定位对比

关键判断(综合 5 篇英文深度评测)

一个被多数评测忽略的事实:dsh 可以通过插件把 Claude Code / Codex 当作子代理调用——它们不是竞争对手,而是 dsh 的一个“工具”。


六、插件生态:机会与风险并存

机会:空白还是蓝海

  • GitHub dsh-plugin topic 已有 900+ 公开插件(官方 + 社区)
  • 空白很多:如“会话→日报/周报/交接文档”直到 8 月中才有人做(dsh-report-studio 作者)
  • 官方内置 100+ 插件,含专为开发设计的 Skill:dsh-code-review(审 PR)、dsh-doc-standards(文档规范)、dsh-find-simplifications(找可简化代码)等

风险:三个必须知道的坑

插件 = 不可信代码
依赖地狱
无插件市场

实战:第一个插件有多难

最小插件只需四个导出(name/inject/Config/apply)+ 一个 defineTool约 20 行代码。但要做出能发布的产品级插件,要处理:数组入参、结构化输出、并发、取消、输入校验、部署限额、peer 依赖、README 写明平面与 realm——复杂度全在后半段


七、安全模型与争议点

安全模型:三档沙箱(只读/工作区可写/完全访问)+ 审批弹窗 + 插件化沙箱策略。但对生产环境:

  • ❌ 无 SOC 2 / ISO 27001(Anthropic 有)
  • ❌ 无安全审计的插件生态
  • ⚠️ 创造模式 = shell 权限,等同信任模型执行任意代码

社区争议(小红书高赞帖):

  • 👍 “二开真的太爽了”(779 赞)—— 可定制性碾压
  • 👎 “恕我直言 DeepSeek Harness 根本不是个 Agent”(95 赞)—— 认为它更多是框架不是产品,普通用户用不上
  • 👍 “保姆级入门教程”(1002 赞)—— 学习资源正在快速补齐

真正的争议点:dsh 发布前两小时,DeepSeek V4-Pro 正式版宣布大幅涨价(API 价格约为原来的 3 倍)。这一冷一热形成强烈反差——框架是免费的,但喂它的模型 API 变贵了。VentureBeat 评价:“DeepSeek 同时追逐两个可能冲突的优势:让 Agent 栈更开放,同时让自家 API 更贵。” 对深度用户,缓存命中率高(98%+)+ 离线权重可选,部分抵消了涨价影响。


八、独立判断与结论

它值不值得用?

适合 dsh 的

  • Agent 开发者 / 研究者:想理解、改造 Agent 运行时的最佳学习对象(“开发者天选的马鞍”)
  • 要造内部 Agent 产品的团队:反正要写 harness,dsh 是现成底板(SpringBrand:“这正是 dsh 设计的场景”)
  • 拒绝模型锁定的团队:一个框架驱动任意模型,dsh 的结构性优势
  • 需要可审计自动化流程:权限边界 + 轨迹视图 + 完全开源
  • 预算敏感的批量自动化:框架免费 + DeepSeek 模型 + 高缓存命中

不适合的

  • 要开箱即用的普通用户:学习成本高、装插件要懂依赖和 realm
  • 生产关键路径:README 用大写字母承诺“将发生破坏性变更”,别赌
  • 追求稳定性的企业:无合规认证、无成熟支持、配置格式可能下月就变

最终评价


评测日期:2026-08-23。本文综合以下信源:智东西《实测DeepSeek Harness》、36氪《深度体验DeepSeek Harness,我原谅它涨价了》、觉醒AI《实测四种模式》、atlascloud《3次运行声称完成,仅1页生效》、实在智能《好用吗?真实体验》、MindStudio《vs Claude Code vs Codex》、VentureBeat、4sAPI《vs Codex vs Claude Code》、apidog《vs Claude Code》、agentpedia《vs Claude Code vs Codex vs Cursor》、SpringBrand《vs Claude Code》、DeepSeek Harness 官方架构文档、GitHub 插件开发实战(dsh-report-studio)。安装体量/内存占用等为本评测独立复核。模型与框架版本可能变动,请以官方为准。