古茗万店运维重构:AI Agent 从「被动告警」到「主动执行」的落地实践
2026/08/26 16:02阅读量 4
古茗科技通过引入阿里云 AI 原生数据库服务(AIDBS),将 DBA 团队从高频重复的救火工作中解放出来,实现运维模式从“告警找人”向“Agent 先接手”的转变。该方案通过 Meta Agent 优化元数据与变更审批、智能值班员自动诊断并辅助决策、以及数据网关保障安全可控三大举措,显著提升了 DDL 审批效率与故障响应速度。这一实践表明,企业级 AI Agent 落地的核心在于明确人机边界,遵循“先标准化、再放权”的原则,让专家经验转化为组织资产。
事件概述
古茗科技集团针对全国上万家门店的高并发数据库运维痛点,与阿里云瑶池数据库团队合作,引入 AI 原生数据库服务(AIDBS)。通过部署 AI Agent,实现了运维流程的重构:由 Agent 承担初步诊断、执行低风险操作及答疑,人类专家专注于关键决策与架构优化。这一转变不仅解决了 DBA 团队人手不足的问题,还推动了研发信任度提升和专家经验的数字化沉淀。
核心信息
1. 痛点背景:传统运维模式的瓶颈
- 规模压力:古茗拥有上万家门店,支撑业务的是 RDS、Redis、MongoDB、PolarDB 等 100 多个数据库实例。尖刺流量频繁,订单量持续增长。
- 人力局限:DBA 团队规模有限,70% 的时间消耗在“接警—登跳板机—看 Process List—Kill 慢 SQL—判断是否扩容”的标准流程中。
- 响应滞后:一次大促处置最快需 10-20 分钟,导致客户下单延迟和门店出杯卡顿。
- 协作低效:MySQL 主库 CPU 飙高频发;元数据分散导致沟通成本高;变更审批流程冗长,DBA 成为研发链路瓶颈。
2. 解决方案:人做判断,Agent 做执行
古茗确立了“人来做判断和决策,Agent 来调度和执行”的核心原则,具体落地为三个方向:
-
数据资产活化与智能辅助
- 机制:不再依赖静态数据字典,而是将 Meta Agent 嵌入研发工作流。在 IDE 写 SQL 时,自动识别表结构、字段口径及索引建议;在变更审批时,自动计算血缘关系、评估影响面和风险等级。
- 效果:低风险操作(如加索引、加配置)由 Agent 直接执行,无需人工逐条审批。DDL 审批时间平均下降 30%–40%。
-
智能值班员:从被动响应到主动诊断
- 机制:改变“出警短信找人”的逻辑,转为“Agent 先诊断”。Agent 自动拉取慢日志、对比历史基线、定位问题 SQL,并提供组合索引、限流或临时扩容等方案供 DBA 选择。
- 效果:在大促等高负载场景下,Agent 能在几分钟内完成定位并给出建议,DBA 一键执行后,整体处置时间缩短至 5 分钟以内。其建议质量与资深 DBA 相当,且更具客观性。
-
安全边界:数据网关与权限管控
- 机制:在 Agent 与生产数据库之间部署数据网关,对 SQL 进行解析、改写,实施越权字段脱敏和危险操作拦截。身份维度从单一账号细化为“场景 + 会话 + 工具”,确保所有操作按 Session 可追溯。
- 效果:解决了 Agent 直连数据库带来的安全和审计风险。目前客服答疑等场景已跑通,Agent 接库周期从平均一两天降至几个小时。
3. 组织与技术双重收益
- 研发自主性提升:由于有 Agent 实时建议和兜底,研发人员对数据库的恐惧感降低,自主变更比例从极低水平提升至过半以上。
- 专家经验资产化:资深 DBA 的个人经验通过 Agent 的每一次处置回流至知识库,形成可复用的组织资产,避免人员流动带来的知识流失。
- 成本与性能优化:Agent 主动评估资源使用情况,指导降配、升配及冷数据归档,在降低单位数据库成本的同时,保障了容量和性能。
- DBA 角色转型:DBA 从 70% 的救火工作中解脱,转而投入架构优化、容量规划和引擎升级等高价值工作。
值得关注
- 落地方法论:古茗运维负责人刘星光强调,AI 不是万能药。成功的落地需要遵循**“先标准化,再自动化;先划好边界,再放开权限”**的顺序。初期应避免让 AI 解决最痛但不可控的场景,而是从有共性、有标准答案的可控场景切入,给予团队磨合期。
- 人机协作边界:当前阶段,人与 Agent 的权限划分需谨慎。过分信任 AI 可能导致风险,因此目前仍保留 DBA 二次确认环节。未来随着磨合深入,可逐步将自治权限提升至 80%–90%,但目前仍以辅助为主。
