METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

미스트랄, 오픈웨이트 안전 분류기 쉴드스트랄 1.0 3B 공개

정책을 텍스트 질문으로 바꿔 재학습 없이 콘텐츠 조정 기준을 바꿀 수 있는 경량 모델

미스트랄, 오픈웨이트 안전 분류기 쉴드스트랄 1.0 3B 공개

이미지: METAL

요약

  • 미스트랄AI가 정책 적응형 멀티모달 안전 분류기 Shieldstral 1.0 3B를 오픈웨이트로 공개했다
  • 고정된 유해 카테고리 대신 자연어 정책 질문에 한 번의 추론으로 안전 점수를 반환하는 방식이다
  • 텍스트 안전 평균 F1 84.9%로 20B급 GPT-OSS-Safeguard와 동등한 성능을 보였다고 밝혔다
모델명
Shieldstral 1.0 3B
기반 모델
Ministral-3-3B-Base-2512 + Pixtral 비전 인코더
학습 데이터
약 5410만 샘플
텍스트 안전 F1
84.9% (GPT-OSS-Safeguard-20B와 동등)
멀티모달 안전 F1
83.8%
라이선스/구동 환경
Apache 2.0, BF16 기준 16GB VRAM 단일 GPU

미스트랄AI가 오픈웨이트 멀티모달 안전 분류기 Shieldstral 1.0 3B를 공개했다. 기존 가드레일 모델 대부분이 유해 카테고리 목록을 가중치에 고정해 두는 것과 달리, 이 모델은 콘텐츠 조정을 하나의 예/아니오 질문으로 처리한다. 운영자가 추론 시점에 자연어로 정책을 질의하면 별도 재학습 없이 한 번의 순전파로 보정된 안전 점수를 얻는 구조다.

구조와 성능

Shieldstral은 Ministral-3-3B-Base-2512에 Pixtral 비전 인코더를 결합해 만들어졌으며, 약 5410만 개 샘플(오픈소스 텍스트 4520만, 합성 대조 텍스트 440만, 멀티모달 450만)로 학습됐다. 미스트랄AI에 따르면 텍스트 안전 평가에서 평균 F1 84.9%를 기록해 20B 규모인 GPT-OSS-Safeguard-20B와 동등한 성능을 보였고, 멀티모달 안전 평가에서는 83.8%로 비교 대상 모든 베이스라인을 앞섰다.

입력은 평가 맥락과 엄격도를 담은 Instruct, 예/아니오 형태의 정책 질문인 Query, 프롬프트·응답·이미지 등을 담는 Document 세 필드로 구성된다. 모델은 yes/no 토큰만을 대상으로 소프트맥스 정규화된 점수를 출력하며, 임계값 0.5를 기준으로 판정한다.

배포 방식

Apache 2.0 라이선스로 공개돼 상업·비상업 목적 모두 사용할 수 있다. BF16 기준 16GB VRAM에서 단일 GPU로 구동 가능하며, vLLM(0.26.0 이상), GGUF 변환을 통한 llama.cpp, SGLang, Transformers 등에서 서빙을 지원하고 Axolotl을 통한 미세조정도 가능하다고 소개됐다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글