蚂蚁发布SingProbe:大模型内生式安全护栏,解码开销低于0.5%

2026/09/14 21:22阅读量 2

蚂蚁AI安全实验室发布大模型内生式安全护栏SingProbe,将安全检测融入生成过程,实现边生成边识别风险。实测显示其在Ling-3.0-flash模型中额外开销低于0.5%,已适配29个主流开源模型并同步开源代码与评测基准。

事件概述

蚂蚁AI安全实验室正式发布大模型内生式安全护栏 SingProbe。该技术旨在解决大模型在真实业务场景中面临的安全审核延迟及计算成本问题,通过“内置探头”机制,让AI在生成回答的同时输出风险提示,从而及时采取中止、告警或重试等措施。

核心技术与性能

  • 内生式检测机制:与传统外置独立护栏不同,SingProbe复用大模型推理过程中已产生的内部信息,通过轻量化模块持续输出风险分数。这种同步进行的方式避免了完整生成后再检查导致的用户可见风险,也降低了高频检查带来的运行负担。
  • 极低资源开销:在 Ling-3.0-flash 模型的生产环境实测中,SingProbe 在解码阶段引入的额外计算开销低于 0.5%
  • 评测表现优异:团队评测显示,其 flash 版本在回答安全分类和流式安全检测任务上超过所选公开基线;在幻觉检测任务上与参考基线基本持平,兼顾了检测能力与运行效率。

应用场景与扩展

  • 医疗场景纠偏:针对医疗领域,团队提出 SingProbe-Med,仅在达到触发条件时对局部高风险内容进行解码干预。在 AntAngelMed-100B 上的评测表明,完整干预能纠正基线模型中 25.03% 原本出错的回答,展示了内生风险信号用于生成过程安全控制的潜力。
  • 流式生成评测基准:同步发布 SingStreamBench,专门关注模型从正常回答转向风险内容的具体时刻,不仅检验发现风险的能力,还考察是否过早触发或发现不及时,以更贴近实际应用的方式衡量防护效果。

开源与适配情况

目前,SingProbe 已适配包括 Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4 在内的 29个 主流开源大模型,并接入 SGLangvLLM 等推理框架。相关代码、模型权重及评测基准均已同步开源,后续团队计划逐步扩展对更多开源模型的支持。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。