
이미지: METAL LAB 생성
摘要
- Mistral AI 以开放权重形式发布了政策自适应多模态安全分类器 Shieldstral 1.0 3B
- 该模型不依赖固定的有害类别,而是通过一次推理对自然语言政策问题返回安全分数
- 据称其文本安全平均 F1 达到 84.9%,性能与 200 亿参数级别的 GPT-OSS-Safeguard 相当
- 모델명
- Shieldstral 1.0 3B
- 기반 모델
- Ministral-3-3B-Base-2512 + Pixtral 비전 인코더
- 학습 데이터
- 약 5410만 샘플
- 텍스트 안전 F1
- 84.9% (GPT-OSS-Safeguard-20B와 동등)
- 멀티모달 안전 F1
- 83.8%
- 라이선스/구동 환경
- Apache 2.0, BF16 기준 16GB VRAM 단일 GPU
Mistral AI 发布了开放权重多模态安全分类器 Shieldstral 1.0 3B。与大多数现有护栏模型将有害类别列表固定写入权重不同,该模型将内容审核处理为一个是/否问题。运营方可在推理阶段用自然语言查询政策,无需额外重新训练,通过一次前向传播即可获得经过校准的安全分数。
结构与性能
Shieldstral 基于 Ministral-3-3B-Base-2512,结合 Pixtral 视觉编码器构建而成,使用约 5410 万条样本(开源文本 4520 万条、合成对照文本 440 万条、多模态数据 450 万条)进行训练。据 Mistral AI 介绍,该模型在文本安全评估中平均 F1 达到 84.9%,与 200 亿参数规模的 GPT-OSS-Safeguard-20B 性能相当;在多模态安全评估中得分为 83.8%,超过所有对比基线模型。
输入由三个字段构成:包含评估背景和严格程度的 Instruct、以是/否形式提出的政策问题 Query,以及承载提示词、回复、图像等内容的 Document。模型仅针对 yes/no 词元输出经过 softmax 归一化的分数,并以 0.5 为阈值进行判定。



