DeepSeek Harness 实测:一夜 5 万星,Agent 界的 Android 来了
DeepSeek 发布首个 Agent 产品 DeepSeek Harness,主打“模型+Harness=Agent”和“一切皆插件”的开放式架构。GitHub 仓库公开 12 小时获超 5 万 star,涨速远超此前最快的 OpenClaw。实测可完成网站重构、API 数据绘图等任务,token 成本不到 3 元,但目前仍是面向开发者的预览版,存在非编程用户不友好、token 消耗较高等争议。
事件概述
DeepSeek 于北京时间 8 月 13 日晚正式发布首个 Agent 产品 DeepSeek Harness(DSH),官方定义是“模型 + Harness = Agent”:模型是“脑子”,Harness 是“手脚”,聊天机器人交付的是一段话,Agent 交付的是一件做完的事。
目前 DSH 不是云端服务,而是一个本地运行的开源工具,需要 Node.js 环境。通过 npx @deepseek-ai/dsh web 启动后,浏览器访问本地 3080 端口即可使用,会话、日志和数据都留存在本地。
核心信息
- GitHub 增长创纪录:仓库公开 12 小时即突破 5 万 star。公开后 21:05 为 7,283 个,21:51 为 15,530 个,不到两小时破万。作为对比,此前增长最快的 OpenClaw 平均每小时约 99 个 star,DSH 前两小时的涨速约为其 80 倍。
- “一切皆插件”架构:模型、工具、界面、审批策略,甚至驱动 Agent 的主循环本身都可以替换,前端也可通过 Prompt 修改。内置标准、极简、代码、创造四种预设,上个月 V4-Flash 在 Terminal Bench 刷榜时使用的就是极简模式。内测阶段开发者已制作约三百个插件。
- 实测表现:在实测中,DSH 被要求按照 The Verge 风格重构极客公园官网,并通过 GitHub API 绘制自身 star 增长曲线,两项任务均完成,全程 token 成本不到 3 元。
- 全程留痕:DSH 提供“轨迹”页,记录模型看到的系统提示词、思维链、每次工具调用和返回结果,这一设计在 Hacker News 上被开发者称为 killer feature,因为美国模型厂商的 API 恰恰把这层数据藏了起来。
争议与行业背景
发布次日,开发者社区的评价开始分化。争议集中在 DSH 目前对非编程用户不友好,以及插件生态的成熟度上。另有第三方对比称,同款 V4-Flash 接入另一个开源 harness Pi,token 消耗只有 DeepSeek Harness 的三成多。
在行业层面,Anthropic 有 Claude Code,OpenAI 有 Codex,DeepSeek 是最新下场做“壳”的大模型厂商,也是第一个将整个 harness 开源的公司。开发者工具公司 Composio 的对照测试显示,同一个 V4-Flash 接入八种不同 harness 完成三十项任务,最好的完成二十项,最差的只有十四项,说明模型相同的情况下,Harness 层会显著影响能力兑现。
值得关注
DeepSeek 做 Harness 有多重现实考量:成本上,上下文组织和缓存命中决定一个任务消耗多少 token,这些逻辑发生在 Harness 层;数据上,任务失败的完整记录是改进模型的重要养料,而记录握在 Harness 手里;生态上,团队已表示会向部分开发者提供 API 额度,目标是把插件开发者留在自己的生态内。
DSH 目前仍是被评价为“像框架、不像成品”的开发者预览版。但换个角度看,早期 Android 同样是粗糙、开放、只吸引动手的人的毛坯状态。DeepSeek 赌的是 Agent 行业也需要一个 Android,而它的做法是把 Agent 的零件全部摊开,让开发者自己去拼装。
