Agent竞争进入“生产系统”时代:Skill不够,Harness才是关键

2026/08/13 03:54阅读量 2

文章指出,Skill只能提供经验软约束,无法保证Agent完成长周期复杂任务,Agent竞争的核心已从Skill封装转向Harness(模型运行生产系统)的搭建。SIGIL实验显示Harness可将流程完成率从56%提升至86%,企业真正需要的是边界清晰、可审计的Agent运行环境。

事件概述

Agent 的能力竞争正在从“封装技能”转向“搭建生产系统”。Skill 能把行业经验按需加载给模型,但它只是软约束,无法保证模型在长周期任务中严格照做。模型外部的运行装置 Harness 则通过上下文管理、工具接入、权限控制、结果验证和错误恢复,把规则变成硬约束,成为 Agent 能否真正落地的关键。

核心信息

1. Skill 无法替代生产运行约束

Skill 将经验拆解为可复用包,解决了上下文过载问题,但无法防止模型遗漏步骤或自作主张。短任务尚可人工修正,长任务中一次跳过测试或误解字段,后续步骤可能全部建立在错误前提上。因此,关键问题不再是“模型知不知道该怎么做”,而是系统能否保证关键步骤发生并验证其确实发生。

2. Harness 是模型的运行保障系统

Harness 包括系统提示词、工具、MCP、文件系统、浏览器、沙箱、状态管理、子 Agent、hooks、验证与日志等,本质是“模型可以干活的环境”。它通过权限卡口、测试门槛、失败回滚等机制,让某些动作没有授权就根本走不下去。2026 年 7 月 30 日的 SIGIL 预印本论文对比了同一流程写成自然语言 Skill 与编译成带类型和前置条件的 Harness,前者完成规定步骤的比例为 56%,后者为 86%,完整流程完成率更高且 token 消耗更少。

3. 竞争焦点转向 Harness 优化

Agent 开始承接长周期复杂任务,模型能力进入可用区间后,Skill 逐步标准化并变得可移植,格式本身难以构成壁垒。8 月 5 日的 Skill-Use benchmark 显示,同一 Skill、同一模型,换一套 Harness 表现会明显变化,模型排名也可能随之改变。OpenAI 在 2026 年 2 月的内部实践也印证了这一趋势:一个不使用人工直接写代码的小团队,前期的瓶颈在于环境没有讲清楚,后来通过隔离 worktree、可查看浏览器/DOM/截图/日志/指标,以及把文档拆成可检索资料,才让 Codex 在五个月内产出约百万行代码和 1500 个 PR(数字为 OpenAI 估算)。LangChain 则表示,仅优化 Harness 就能让一个 Coding Agent 在 Terminal-Bench 2.0 上从 30 名以外升至第 5 名。模型周围的工具、状态、反馈与约束,已成为产品竞争力的核心差异点。

4. 价值集中在真实业务的可落地性

单独一份 Skill 很容易被复制或重写,真正难复制的是对“SOP 在真实工作中会在哪一步失效”的认知。法律、财务等垂直领域的机会,更多在于任务失效点应对、验证标准、权限整合、审批节点和审计路径,而非漂亮的 Skill 文件。企业最终需要的是一个边界清楚、可审计的 Agent 运行环境,Token 只是成本结构中的一项。

5. Harness 需按任务风险搭建,而非越厚越好

过度堆叠子 Agent、MCP、memory、planner、hooks 等会带来维护、算力和过拟合风险。自动化程度应由任务风险和结果可验证性决定:写生日祝福这类低风险任务用薄 Harness 即可;线上服务修改需要更完整工具、验证和回滚;付款、医疗、金融交易等不可逆任务,则必须优先设计审批、事务、回滚和审计。

结论

Skill 不会消失,会像 package 一样标准化,但经验被读到距离经验变成结果之间仍有很长的距离。Harness 也不会消失,而是发生迁移:帮模型补认知短板的部分会变薄,围绕现实世界行动约束的部分会变厚。未来真正决定 Agent 价值的,是它能否在业务中留下失败记录、验证标准和可管理的边界。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。