AI执行安全:从统计正确率到控制错误边界的七个数学视角
2026/07/22 00:09阅读量 2
AI获得现实执行能力后,传统正确率指标无法覆盖安全风险。文章从风险评估、历史数据、非均匀风险、独立冗余、全链路可靠度、置信度局限、降概率转向控后果七个数学视角,重构AI执行安全评估思路,强调最终需设置简单刚性的底线来限制错误造成的破坏范围。
事件概述
AI从“回答问题的模型”转变为“执行现实的系统”(如发邮件、改数据库、批订单、调资金、控制设备)后,错误不再可撤销。传统正确率指标无法反映最坏情况的风险。文章基于七个基本数学原理,提出重构AI执行安全评估的思路。
核心信息
- 正确率忽视损失差异:正确率只统计错误次数,不区分一次错误是误删邮件还是误转亿元资金。安全评估应使用“风险=概率×损失”公式,并关注极端损失的“风险尾巴”,不能仅靠期望值平摊。
- 历史无事故≠风险为零:根据公式(1-p)^n,若单次事故概率为十万分之一,运行一万次仍有约90%概率不发生事故。未观察到风险不等于风险不存在。
- 风险集中在低概率高后果场景:罕见事故的平均风险远高于常见小错(如0.001%概率损失1000万 vs 1%概率损失100元,平均风险前者100倍)。占业务量1%的高难度场景可能制造80%以上的错误,评估需拆分高风险场景。
- 冗余不独立则无效:多人审批需判断独立。三个10%错误率的独立审批者同错概率约2.8%;若共享同一错误信息,增加流程仅增加签名,真实风险几乎不降。审批的价值在于获取独立信息源。
- 全链路可靠度衰减:五个99%可靠环节串联后整体可靠度仅约95.1%。最终安全边界应设置简单刚性的“全条件满足才执行”规则,拒绝任何例外突破。
- 从降概率转向控后果:AI执行后错误不可逆。应假设错误迟早发生,额外设置刹车和护栏限制破坏范围,用独立底线拦住不确定性。
核心结论
概率可以参与判断,但不能独自拥有执行权。安全系统必须从“提高正确率”转向“限制错误的距离”,即当错误发生时,它不能走远。
