AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Shieldstral – 정책을 프롬프트로 바꾸는 Mistral 멀티모달 안전 분류기

Shieldstral은 Mistral AI가 공개한 3B 오픈웨이트 멀티모달 안전 분류기다. 기존 moderation 모델처럼 고정된 위해 카테고리를 학습해 두는 대신, 배포자가 자연어 정책을 질문 형태로 넣으면 텍스트와 이미지를 같은 인터페이스로 판정한다.

핵심 아이디어

Shieldstral은 콘텐츠 moderation을 이진 질문응답(binary question answering)으로 재구성한다. 입력은 세 부분으로 나뉜다.

구성역할
<Instruct>평가 맥락, 엄격도, unsafe 정의
<Query>예: “이 콘텐츠가 보호 집단에 대한 폭력을 조장하는가?” 같은 yes/no 질문
<Document>판정할 프롬프트, 응답, 프롬프트-응답 쌍, 이미지

모델은 yesno 로짓만 읽고 softmax로 연속 안전 점수를 만든다. 따라서 하나의 체크포인트로 prompt classification, response moderation, refusal detection, toxicity detection을 처리할 수 있고, 정책 변경은 재학습이 아니라 프롬프트 변경으로 다룬다.

왜 중요한가

AI 제품의 안전 기준은 도메인마다 다르다. 같은 보안 취약점 설명도 사이버 교육 제품에서는 허용될 수 있지만 일반 소비자 챗봇에서는 차단 대상일 수 있다. 고정 taxonomy 기반 가드레일은 이런 맥락 차이를 모델 가중치 안에 묶어 버리기 때문에, 제품별 정책을 반영하려면 추가 학습이나 별도 분류기가 필요하다.

Shieldstral의 장점은 정책을 런타임 입력으로 분리한 점이다. 팀은 “금지 카테고리”를 코드나 프롬프트 정책으로 관리하고, 분류기는 그 정책 문장을 기준으로 콘텐츠가 위반되는지 판단한다. 안전 정책이 자주 바뀌는 플랫폼, 커뮤니티, 엔터프라이즈 앱에 특히 실용적이다.

특징

항목내용
크기3B
입력텍스트, 이미지, 텍스트+이미지
출력yes/no 확률 기반 연속 안전 점수
정책 적응자연어 질의로 inference time에 조정
실행단일 16GB NVIDIA GPU에서 실행 가능하다고 Mistral이 설명
라이선스Apache 2.0 오픈웨이트

Mistral은 Shieldstral이 텍스트 안전, 거절 감지, 정책 적응성, 멀티모달 안전 벤치마크에서 최대 7배 큰 오픈 guard 모델과 비슷하거나 더 나은 성능을 보였다고 설명한다.

학습 접근

Shieldstral의 핵심은 모델 크기보다 데이터 정규화다. Mistral은 서로 다른 공개 안전 데이터셋의 taxonomy, 라벨 형식, annotation convention을 instruction-query-document 형식으로 맞췄다. 또한 비슷하지만 경계가 다른 정책 쌍을 만들어, 모델이 단순히 “unsafe”라는 라벨을 외우는 것이 아니라 어떤 정책을 위반했는지 구분하도록 훈련했다.

이미지 안전 데이터는 텍스트처럼 합성하기 어렵기 때문에, 제한된 moderation 데이터에 일반 이미지 데이터셋의 negative sample을 보강하고 vision-language reranker로 이미지-질문 쌍의 라벨 오류를 줄였다고 설명한다.

어디에 쓰면 좋은가

  • 사용자 생성 콘텐츠 플랫폼에서 제품별 moderation 정책을 빠르게 바꿔야 할 때
  • 챗봇 응답의 거절 여부, 정책 준수 여부, prompt-response pair 안전성을 함께 보고 싶을 때
  • 텍스트와 이미지를 같은 정책 언어로 심사해야 하는 멀티모달 앱
  • 폐쇄형 safety API 대신 오픈웨이트 guard 모델을 자체 배포하려는 팀

주의할 점

정책을 자연어로 넣는 구조는 유연하지만, 정책 문장 자체가 모호하면 판정도 흔들린다. 프로덕션에서는 정책 문구 버전 관리, threshold calibration, 사람이 검토한 golden set, false positive/false negative 분석이 함께 필요하다. 또한 안전 분류기는 차단 결정을 돕는 계층이지, 권한·감사·이의제기 프로세스를 대체하지 않는다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)