
이미지: METAL
요약
- 미스트랄AI가 정책 적응형 멀티모달 안전 분류기 Shieldstral 1.0 3B를 오픈웨이트로 공개했다
- 고정된 유해 카테고리 대신 자연어 정책 질문에 한 번의 추론으로 안전 점수를 반환하는 방식이다
- 텍스트 안전 평균 F1 84.9%로 20B급 GPT-OSS-Safeguard와 동등한 성능을 보였다고 밝혔다
- 모델명
- Shieldstral 1.0 3B
- 기반 모델
- Ministral-3-3B-Base-2512 + Pixtral 비전 인코더
- 학습 데이터
- 약 5410만 샘플
- 텍스트 안전 F1
- 84.9% (GPT-OSS-Safeguard-20B와 동등)
- 멀티모달 안전 F1
- 83.8%
- 라이선스/구동 환경
- Apache 2.0, BF16 기준 16GB VRAM 단일 GPU
미스트랄AI가 오픈웨이트 멀티모달 안전 분류기 Shieldstral 1.0 3B를 공개했다. 기존 가드레일 모델 대부분이 유해 카테고리 목록을 가중치에 고정해 두는 것과 달리, 이 모델은 콘텐츠 조정을 하나의 예/아니오 질문으로 처리한다. 운영자가 추론 시점에 자연어로 정책을 질의하면 별도 재학습 없이 한 번의 순전파로 보정된 안전 점수를 얻는 구조다.
구조와 성능
Shieldstral은 Ministral-3-3B-Base-2512에 Pixtral 비전 인코더를 결합해 만들어졌으며, 약 5410만 개 샘플(오픈소스 텍스트 4520만, 합성 대조 텍스트 440만, 멀티모달 450만)로 학습됐다. 미스트랄AI에 따르면 텍스트 안전 평가에서 평균 F1 84.9%를 기록해 20B 규모인 GPT-OSS-Safeguard-20B와 동등한 성능을 보였고, 멀티모달 안전 평가에서는 83.8%로 비교 대상 모든 베이스라인을 앞섰다.
입력은 평가 맥락과 엄격도를 담은 Instruct, 예/아니오 형태의 정책 질문인 Query, 프롬프트·응답·이미지 등을 담는 Document 세 필드로 구성된다. 모델은 yes/no 토큰만을 대상으로 소프트맥스 정규화된 점수를 출력하며, 임계값 0.5를 기준으로 판정한다.
배포 방식
Apache 2.0 라이선스로 공개돼 상업·비상업 목적 모두 사용할 수 있다. BF16 기준 16GB VRAM에서 단일 GPU로 구동 가능하며, vLLM(0.26.0 이상), GGUF 변환을 통한 llama.cpp, SGLang, Transformers 등에서 서빙을 지원하고 Axolotl을 통한 미세조정도 가능하다고 소개됐다.





댓글