每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Mistral 发布开放权重安全分类器 Shieldstral 1.0 3B

将政策转化为文本问题、无需重新训练即可调整内容审核标准的轻量模型

이미지: METAL LAB 생성

摘要

  • Mistral AI 以开放权重形式发布了政策自适应多模态安全分类器 Shieldstral 1.0 3B
  • 该模型不依赖固定的有害类别,而是通过一次推理对自然语言政策问题返回安全分数
  • 据称其文本安全平均 F1 达到 84.9%,性能与 200 亿参数级别的 GPT-OSS-Safeguard 相当
모델명
Shieldstral 1.0 3B
기반 모델
Ministral-3-3B-Base-2512 + Pixtral 비전 인코더
학습 데이터
약 5410만 샘플
텍스트 안전 F1
84.9% (GPT-OSS-Safeguard-20B와 동등)
멀티모달 안전 F1
83.8%
라이선스/구동 환경
Apache 2.0, BF16 기준 16GB VRAM 단일 GPU

Mistral AI 发布了开放权重多模态安全分类器 Shieldstral 1.0 3B。与大多数现有护栏模型将有害类别列表固定写入权重不同,该模型将内容审核处理为一个是/否问题。运营方可在推理阶段用自然语言查询政策,无需额外重新训练,通过一次前向传播即可获得经过校准的安全分数。

结构与性能

Shieldstral 基于 Ministral-3-3B-Base-2512,结合 Pixtral 视觉编码器构建而成,使用约 5410 万条样本(开源文本 4520 万条、合成对照文本 440 万条、多模态数据 450 万条)进行训练。据 Mistral AI 介绍,该模型在文本安全评估中平均 F1 达到 84.9%,与 200 亿参数规模的 GPT-OSS-Safeguard-20B 性能相当;在多模态安全评估中得分为 83.8%,超过所有对比基线模型。

输入由三个字段构成:包含评估背景和严格程度的 Instruct、以是/否形式提出的政策问题 Query,以及承载提示词、回复、图像等内容的 Document。模型仅针对 yes/no 词元输出经过 softmax 归一化的分数,并以 0.5 为阈值进行判定。

部署方式

该模型以 Apache 2.0 许可证发布,商业和非商业用途均可使用。在 BF16 精度下可在单张 16GB 显存 GPU 上运行,支持通过 vLLM(0.26.0 及以上版本)、经 GGUF 转换后的 llama.cpp、SGLang、Transformers 等方式提供服务,并可通过 Axolotl 进行微调。