企业AI从Demo到生产,必须跨越的9道工程关卡
企业AI要从演示走向生产,关键不再是模型能力,而是系统工程能力。文章提出9道必须跨越的关卡:场景选择、数据治理、模型可靠性、权限控制、执行边界、异常处理、有效人工接管、证据记录和降级机制。只有补齐这些环节,概率性的智能体才能承担确定性的生产责任。
企业AI落地正经历从“模型问题”到“系统工程问题”的转变。过去两年,企业习惯先找场景、整理数据、选模型、做Demo,再尝试接入业务系统。但当Agent开始连接CRM、ERP、数据库、支付接口甚至工业设备后,真正的问题变成:怎样让AI成为一个可进入生产系统的组成部分。
完整链路为:场景→数据→模型→权限→执行→异常→人工接管→证据→降级。其中前三个环节解决“AI有没有能力完成任务”,从权限开始,面对的是“AI可以做什么、出错后谁能阻止、出了问题能否解释”。
一、场景选择
企业不应问“哪里可以用AI”,而应回答“为什么这个问题过去一直没有被很好地自动化”。AI真正适合的是非结构化信息理解、规则无法穷举或人工判断成本过高的场景。规则清楚、输入稳定、结果可验证的确定性流程,用规则引擎、RPA或传统软件即可,引入概率模型反而增加复杂度。
二、数据
模型并不直接接触现实,它理解的世界来自企业提供的数据。数据过期、缺失或冲突时,AI准确执行错误数据比模型幻觉更致命。数据治理的含义因此变化:不仅要让模型能读到数据,还要确保数据足以代表当前现实,并处理“不知道”的情况。
三、模型可靠性
参数规模、Benchmark、上下文长度等指标衡量的是平均能力,而生产环境面对的是大量不可预测的边界情况。关键问题不是“模型平均回答得有多好”,而是“模型在不知道的时候会怎么办”。成熟系统必须承认不确定性,并确保模型的不确定性不会在后续环节被自动放大成确定性行动。
四、权限
能读取知识库的AI与能修改订单的AI是完全不同的系统。Agent让机器获得了读数据库、写数据库、创建工单、发送邮件、提交代码甚至执行交易的能力。核心风险不再是模型“看到了什么”,而是它拥有多大的行动能力。权限一旦授予,模型错误的性质就会从信息错误变成行动错误。
五、执行
建议、决策和执行是三个不同层次。模型生成付款建议是信息输出,系统确认付款符合条件是决策,资金真正转出才叫执行。建议可以修改,判断可以重新计算,但资金转移、数据删除、设备关闭等操作发生后,现实状态已经不可回退。生产系统必须在“AI想做什么”与“现实允许发生什么”之间建立边界。
六、异常处理
Demo只需展示正常路径,生产系统必须设计失败路径。网络中断、模型超时、数据延迟、第三方接口变化、多系统状态冲突都会出现。更复杂的是,Agent执行多步骤任务时,现实业务本身可能已发生变化。系统越具自主解决问题的能力,就越需要明确什么情况下不应该继续解决问题。
七、人工接管
Human in the Loop并不天然意味着安全。高频、重复且绝大多数时候无异常的确认机制会产生自动化疲劳,最终变成机械点击。有效的人工接管应只在风险升高、模型置信度不足、数据源冲突、操作超出边界或现实状态无法确认时触发。人不应该成为AI流程中的按钮,而应成为面对不确定性时的判断能力。
八、证据与日志
Agent执行一次操作可能经过很长的链路:用户提出目标、模型理解目标、生成计划、调用工具、调整计划、再次调用系统、最终触发操作。出问题时,仅知道“某个API被调用”远远不够。企业需要回答:为什么调用、依据什么信息、谁授予权限、执行参数是否变化、最终执行对象是否与批准对象一致。日志因此从调试工具变成责任认定、内部审计和合规治理的基础。
九、降级机制
模型供应商故障、网络中断、推理成本变化或模型升级后表现下降,都可能让AI不可用。若关键流程失去AI服务就无法运转,只是把人工依赖换成了技术依赖。成熟系统应具备降级能力:无法全自动时退回半自动,模型不可靠时退回规则系统,规则不可用时退回人工。重要系统不能把生存能力建立在某一个组件永远正常这一假设上。
结论
Demo只需要证明“能够成功一次”,生产系统必须证明“即使失败,企业仍然知道该怎么办”。两者之间隔着的正是权限体系、执行控制、异常处理、人工接管、证据链和降级机制。企业AI下一阶段的深层竞争,是如何把概率性的智能体放进一个必须承担确定性责任的现实系统。
