Agent 开始实际干活,大厂终于补上评测与可观测性这条「质检线」
随着 Agent 进入 CRM、工单、支付等真实业务流程,仅凭技术指标已无法判断任务是否办对。Google、微软、Grafana 近期相继发布或更新 Agent 评测与可观测性能力,将真实执行轨迹转化为测试样本,并用规则、大模型与人工复核组合完成质检。行业正在把“什么算一次可靠交付”的标准沉淀为企业资产。
事件概述
Agent 开始进入 CRM、工单、支付、代码库等真实业务系统后,企业关心的不再是“它会不会做”,而是“它做完算不算做对”。近期 Google、微软、Grafana 等厂商都在补同一件事:给 Agent 装上由评测(Eval)与可观测性(Observability)组成的质检线。
关键时间线:
- 4月:Google 发布 Gemini Enterprise Agent Platform,将模拟、评测和可观测性放入 Agent 的“优化”层。
- 5月:Microsoft Build 上,Foundry 展示多轮评测、生产轨迹抽样、轨迹回放和由轨迹生成测试集。
- 7月:Grafana 将 Agent Observability 推向通用可用,并把 agent session 称为指标、日志、链路追踪、性能剖面之外的第五类遥测信号。
核心信息
传统监控无法覆盖 Agent 的“安静失败”。Agent 可以在接口返回 200、技术指标全部正常的情况下把业务办错,比如订错航班日期、填错客户字段、退款只完成查询。错误会直接落到真实世界,且模型、提示词、工具配置任一环节变化都可能导致行为漂移。Anthropic 复盘 Claude Code“变笨”时也发现,模型本身未降级,问题来自默认推理强度、上下文清理、系统提示词等产品层变化叠加,且内部既有评测一开始未复现用户问题。
可观测性与评测分工不同。可观测性记录执行全轨迹(用户请求、工具调用、参数、重试、耗时成本等),用于排查与审计;评测判断结果与过程是否合格,例如退款是否到账、工单是否关闭、是否调用高风险工具。微软的表述是:轨迹回答发生了什么,评测判断好不好,优化决定下一步改哪里。
质检线需要真实生产数据与多种裁判。生产环境中的失败案例是最有价值的回归测试样本,应清理、脱敏、标注后存入测试集。确定性检查(订单是否生成、金额是否正确、权限是否越界)交给规则/脚本;开放性判断(回复是否准确、客服是否理解投诉)交给大模型;高风险和分歧样本由人工复核。人不需要逐条检查,系统先把新的失败类型、重要客户、高风险动作挑出来。
值得关注
- 评测会倒逼企业把业务验收标准说清楚。“客服更有帮助”“报告质量更高”这类模糊要求,必须转化为可检查的规则;失败样本、验收规则和真实结果数据的积累,会形成难以复制的资产。
- 不要把开放任务的正确路径写死。只要最终业务结果正确且未触碰安全、权限红线,就应允许 Agent 自主选择路径;过程评测应聚焦安全、合规、权限、成本和不可逆的高风险动作。
- 可观测性本身有成本和风险。轨迹包含用户输入、内部文档、客户资料,需权限管控与脱敏;用生产轨迹抽样平衡观测成本,而不是每条执行都交给模型打分。
- 标准和平台之争已经开始。Google、微软在争夺开发者使用哪个控制台,Grafana 则把 Agent 接入已有监控体系。OpenTelemetry 等开放标准能否用通用语义记录模型调用、工具调用、token 消耗和状态变化,将影响企业将来迁移时能否带走运行经验。
