Mistral AI 发布 Shieldstral:3B 小模型如何用规则自适应统一文本与图像审核

2026/08/17 17:02阅读量 2

Mistral AI 推出 3B 级多模态安全分类器 Shieldstral,将内容审核转化为自然语言规则与内容的 Yes/No 判断,支持在推理阶段自定义审核规则,统一处理文本、图片和图文混合内容。在多个安全基准上,其表现接近或超过参数量更大的模型,HarmBench 文本审核 F1 达 99.4%。

事件概述

2026 年 8 月 4 日,法国大模型厂商 Mistral AI 发布 Shieldstral,一款 3B 级规则自适应多模态安全分类器。它通过统一接口审核文本、图片及图文混合内容,并允许企业在推理阶段用自然语言自定义审核规则,以适应不同业务场景。

核心设计:将审核转为判断题

Shieldstral 将安全审核统一为“自然语言审核规则 + 待审内容 → 是否命中规则(yes/no)”的格式,由三个可配置字段组成:

  • <Instruct>:规定审核场景和判断尺度;
  • <Query>:提出本次需要检查的具体问题;
  • <Document>:提供待审核的文本、图片或图文混合内容。

模型输出 yes 或 no,系统可提取两个 token 的概率并归一化为 0 到 1 的连续分数,供业务方结合阈值决定放行、拦截或人工复核。这种设计使规则调整无需重新训练模型,同时确保文本与图像判定尺度一致。

训练数据与对比式训练

为避免模型仅根据内容“是否危险”作答而不深入匹配具体规则,Shieldstral 采用对比式训练:保持内容不变,改变问题,让模型在不同规则下给出不同答案。例如,对同一段描述非法拘禁的内容,面对“是否涉及非法拘禁?”输出 yes,面对“是否包含种族仇恨?”则输出 no。

训练体系包含 11 个上层类别和 73 个叶子类别,并据此生成约 440 万条合成对比文本样本。消融实验显示,加入合成对比数据后,细粒度规则验证集 F1 从 61.1% 提升至 84.4%,提升 23.3 个百分点。

视觉能力扩展

Shieldstral 针对违规图片稀缺、标注成本高的问题,重点增加规则问题的多样性,生成了约 2000 种不同措辞的审核问题,其中约 30% 采用反向问法(如“这张图片是否包含暴力内容?”)。

数据来源包括违规图片、干净图片以及通用图像分类和目标检测数据。团队还构造困难负样本,例如呈现激烈争执但无身体伤害的图片,应回答“no”。数据管线使用视觉语言重排序模型对“图片—规则问题”样本进行复核,过滤标签错误和图文不一致的样本,最终构建约 450 万条多模态训练样本。

基准评测表现

  • 文本安全场景:HarmBench F1 为 99.4%,优于 GPT-OSS-Safeguard-20B、LlamaGuard-4-12B 等更大参数模型;WildGuardTest F1 为 88.1%,与体量约 7 倍的 GPT-OSS-Safeguard-20B 基本持平;XSTest F1 为 94.6%。
  • 多模态安全场景:VLGuard F1 为 97.7%,位列榜首;UnsafeBench F1 为 81.8%,领先第二名约 10 个百分点。

值得关注

Shieldstral 通过将内容审核转化为“规则—内容”匹配问题,用小参数模型实现了接近甚至超越大模型的细粒度、多模态安全判别能力。它定位于轻量级规则判断模型,不负责完整的内容治理流程,风险分数解释、阈值设置和最终处置仍由业务系统决定。该方案展示了垂直场景中小模型以更轻量灵活的设计达到高性能的可行路径。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。