AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

AI Red-Teaming 튜토리얼 – Garak으로 LLM 앱 공격 시나리오 점검하기

AI Red-Teaming은 LLM 앱이 악의적 입력, 민감정보 유출, 과도한 도구 실행, 정책 우회 시도에 어떻게 반응하는지 반복적으로 확인하는 보안 테스트다. 모델 자체만 시험하는 것이 아니라 실제 프롬프트, RAG, 도구, 권한, 로그 흐름을 함께 봐야 한다.

무엇을 먼저 테스트할까

초기 레드팀 범위는 넓게 잡기보다 실패 정의를 명확히 하는 편이 낫다.

공격 범주실패 예시
프롬프트 인젝션외부 문서의 지시가 시스템 지시보다 우선된다
민감정보 노출API 키, 고객 데이터, 내부 문서가 응답에 섞인다
과도한 에이전시승인 없이 메일 발송, 결제, 삭제 같은 행동을 한다
권한 우회사용자 권한 밖의 도구나 데이터에 접근한다

Garak으로 시작하는 흐름

Garak은 LLM 취약점 스캐너로, 여러 probe를 실행해 모델·앱 응답을 평가하는 데 쓸 수 있다. 운영 앱에 바로 붙이기 전에 스테이징 환경과 테스트 계정을 준비해야 한다.

pipx install garak
garak --model_type openai --model_name gpt-4.1-mini

실전에서는 모델 이름만 바꾸는 것으로 충분하지 않다. RAG 검색, MCP 도구, 권한 승인 UI까지 포함한 “실제 앱 경로”를 테스트해야 의미가 있다. 실패가 나오면 프롬프트를 고치는 것에서 멈추지 말고 도구 권한, 출력 필터, 데이터 분리, 감사 로그를 함께 고친다.

반복 운영 기준

레드팀은 출시 직전 한 번 하는 행사가 아니다. 새 도구가 추가되거나 검색 인덱스가 바뀌거나 시스템 프롬프트가 바뀔 때마다 회귀 테스트로 돌려야 한다.

  • 실패 기준을 JSON 또는 표로 기록한다.
  • 공격 카테고리별 대표 케이스를 고정한다.
  • 방어 패치 후 같은 케이스를 다시 실행한다.
  • “모델이 거부했다”와 “앱이 권한을 차단했다”를 분리해 기록한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)