DeepSeek Harness开源实测:插件化架构面向自进化,长任务能力亮眼
DeepSeek Harness正式开源。作为围绕DeepSeek模型的Agent框架,它采用Cordis插件化架构,内置100多个插件,模型、工具、策略、存储、上下文管理均可替换;实测中长任务完成度明显优于Codex,但UI细节仍有差距。官方计划8月17日调整API价格,缓存相关费用涨幅明显。
事件概述
DeepSeek Harness(文中昵称“黑鲸”)正式发布并开源。体验者在使用近半个月后给出的评价是:这是一套为“自进化”和“DIY”而设计的Agent框架,模型、工具、策略、存储、上下文管理均以插件形式存在,可替换、可自定义,官方已内置100多个插件。
安装与使用
- 快速启动:
npx @deepseek-ai/dsh web - 源码安装:
git clone https://github.com/deepseek-ai/deepseek-harness - 目前没有Electron客户端,需通过浏览器Web UI使用。
- 首次使用需配置DeepSeek API Key,也可接入其他模型。
使用上的两个关键差异:
- 会话开始前需额外选择工作目录和Agent预设。
- 官方提供四类预设:标准模式(完整编码Agent)、PTC模式(额外提供Code Mode SDK,允许模型编写TypeScript程序组合多步操作)、极简模式(仅保留bash和str_replace_editor,用于基准测试和最小化复现)、创造模式(增加运行时检查、插件实验和preset创作指导),并支持自定义预设。
核心功能与体验
- 轨迹(Trajectory):可回放原始事件级记录,查看模型在会话中每一步的操作与Token消耗,便于定位失败环节。
- 主动追问:即使未开启计划模式,指令不明确时也会主动提问并给出建议选项,减少用户心智负担。
- 开发向Skill:内置dsh-code-review(审PR)、dsh-find-simplifications(代码简化建议)、dsh-doc-standards(文档规范)、dsh-prose-standard(文案品控)等。
- Token仪表盘:界面底部实时统计Token消耗量和缓存命中率。实测缓存命中率大多在99%左右,个别场景为100%,也曾降至60-70%。
- 图片附件:支持上传图片,但DeepSeek V4不具备视觉能力,需搭配多模态模型使用。
与Codex对比实测
在相同模型(V4 Flash)和推理强度下,对比DSH与Codex:
- “鹈鹕自行车”测试两者表现接近,但Codex的审美略好。
- “猪八戒3D白模”测试中,一句话指令下Codex约6分钟完成但结果明显失真;DSH跑了约20分钟,产出更完整。
- 社区有用户用DSH连续运行任务长达10小时。体验者认为,DSH更擅长长程任务,很少直接交付半成品,例如仅凭一句prompt生成了包含下蹲、换弹、瞄准、NPC等功能的第一人称射击游戏。
- 不足之处:右侧栏尚未完成,内置浏览器、文件管理、预览等UI交互细节与Codex相比仍有差距。
架构:Cordis与“一切皆插件”
DSH的底层围绕Cordis协议设计,类似乐高底板:把Agent运行时拆成独立插件,各司其职。开发者可以按规则编写新插件插入,也可随时替换不满意的插件。仓库内提供从零构建插件、接入官方Harness的完整教程,以及一个用于修改Cordis的Skill。
这与Codex开源Harness形成两种路线:Codex采用Rust单体核心+外部扩展(MCP、hooks、skills),封闭但可控;DSH则把核心能力全部插件化,并预留Plugin Store。官方已内置100多个插件,社区也出现了TUI、皮肤、emoji等扩展。体验者将这种模式称为“Agent时代的安卓”。
值得关注
官方将DSH定位为“开源、开放、可复用、可组合的基础设施”,期待全球开发者共同构建插件生态。理论上,模型可以在不打断任务的前提下自己写插件并安装,再通过海量Agent实例筛选出验证过的优秀插件回流主线,从而让“自进化”有了更落地的实现路径。不过对普通用户而言,插件生态的收益还要等待高质量插件沉淀。
另据文章信息,DeepSeek计划于8月17日调整API价格,缓存相关费用涨幅尤为明显。
