AI巨头争夺“错题本”:数据飞轮成下一代竞争关键

2026/07/21 08:43阅读量 3

AI公司正围绕代码和办公场景推出Agent产品,通过用户的操作反馈积累高价值训练数据,形成“错题本”式的数据飞轮。Anthropic的Claude Code、腾讯的WorkBuddy、OpenAI的ChatGPT桌面端等竞相入场,试图在真实工作流中建立模型持续改进的闭环。模型能力与产品体验的非线性关系,使得抢占工作流和构建Harness系统成为新的竞争壁垒。

事件概述

7月,AI巨头在代码和办公场景的Agent产品竞争加剧。OpenAI发布新版ChatGPT桌面端,将Codex和Work标签整合进界面,瞄准程序员终端和办公流程。Anthropic的Claude Code在SWE-bench上取得93.9%的成绩后,进一步推出Claude Cowork接管表格、文档和企业流程。腾讯的WorkBuddy在2026年快速崛起,PC端月访问量达885万,成为中国同类产品日活第一。马斯克则以600亿美元收购代码编辑器Cursor,用于训练Grok 4.5。

核心信息

  • 数据飞轮成为核心竞争逻辑:AI产品通过吸引用户完成真实工作,收集用户的接受、拒绝、修改等反馈信号。这些信号比公开语料更珍贵,因为它们记录了模型错误和人类修正过程,可转化为训练下一代模型的数据。Anthropic的ARR从年初140亿美元涨至470亿美元,企业市场份额34.4%,反超OpenAI,正是得益于Claude Code和Claude Cowork积累的数据飞轮。
  • Harness系统是飞轮的关键:Harness指驾驭模型的系统,负责拆解任务、检查结果、将用户行为反馈提炼为训练数据。代码场景有明确的对错信号(编译通过、测试通过),办公场景任务链更长、反馈更密集。Harness的成熟度决定了飞轮能否真正转动,Anthropic在该领域已有两年积累。
  • 案例对比:腾讯从CodeBuddy编程助手起步,打磨Harness,再推出WorkBuddy办公智能体。WorkBuddy产生的真实反馈被用于训练混元模型Hy3,Hy3接入后WorkBuddy首响应提速54%,任务总时长缩短47%,任务成功率从72%升至90%。马斯克通过收购Cursor获得开发者工作流数据,Grok 4.5在SWE-bench Pro上达到64.7%(同期Claude Opus 4.8为69.2%)。
  • 模型与产品非线性关系:过去认为堆算力和数据就能线性提升模型能力,但现在Harness表明,即使不更新模型权重,优化外部系统也可提升任务成功率。这给了后发者窗口:通过抢占工作流、构建数据飞轮,可以从产品端反向推动模型进步。

值得关注

  • 巨头路径分化:Anthropic和OpenAI从模型领先出发,腾讯从产品先跑出发,马斯克用收购补足数据管道。最终争夺的都是高价值工作流中的真实反馈数据。
  • 竞争维度升级:下一轮竞争不再仅靠模型榜单,而是看谁能在千万次真实任务中持续优化模型循环,形成“复利”效应。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。