AI Red-Teaming은 LLM 앱이 악의적 입력, 민감정보 유출, 과도한 도구 실행, 정책 우회 시도에 어떻게 반응하는지 반복적으로 확인하는 보안 테스트다. 모델 자체만 시험하는 것이 아니라 실제 프롬프트, RAG, 도구, 권한, 로그 흐름을 함께 봐야 한다.
무엇을 먼저 테스트할까
초기 레드팀 범위는 넓게 잡기보다 실패 정의를 명확히 하는 편이 낫다.
| 공격 범주 | 실패 예시 |
|---|---|
| 프롬프트 인젝션 | 외부 문서의 지시가 시스템 지시보다 우선된다 |
| 민감정보 노출 | API 키, 고객 데이터, 내부 문서가 응답에 섞인다 |
| 과도한 에이전시 | 승인 없이 메일 발송, 결제, 삭제 같은 행동을 한다 |
| 권한 우회 | 사용자 권한 밖의 도구나 데이터에 접근한다 |
Garak으로 시작하는 흐름
Garak은 LLM 취약점 스캐너로, 여러 probe를 실행해 모델·앱 응답을 평가하는 데 쓸 수 있다. 운영 앱에 바로 붙이기 전에 스테이징 환경과 테스트 계정을 준비해야 한다.
pipx install garak
garak --model_type openai --model_name gpt-4.1-mini실전에서는 모델 이름만 바꾸는 것으로 충분하지 않다. RAG 검색, MCP 도구, 권한 승인 UI까지 포함한 “실제 앱 경로”를 테스트해야 의미가 있다. 실패가 나오면 프롬프트를 고치는 것에서 멈추지 말고 도구 권한, 출력 필터, 데이터 분리, 감사 로그를 함께 고친다.
반복 운영 기준
레드팀은 출시 직전 한 번 하는 행사가 아니다. 새 도구가 추가되거나 검색 인덱스가 바뀌거나 시스템 프롬프트가 바뀔 때마다 회귀 테스트로 돌려야 한다.
- 실패 기준을 JSON 또는 표로 기록한다.
- 공격 카테고리별 대표 케이스를 고정한다.
- 방어 패치 후 같은 케이스를 다시 실행한다.
- “모델이 거부했다”와 “앱이 권한을 차단했다”를 분리해 기록한다.
관련 문서
- claude-security — Claude 보안 및 안전 관련 정보
- zero-trust-ai-agents — 자율 AI 에이전트 보안 아키텍처
- prompt-injection-role-confusion — 역할 혼동 기반 프롬프트 인젝션
- skillspector — AI 에이전트 스킬 취약점 보안 스캐너
참고 자료
- A Complete Guide to AI Red-Teaming (With Garak Tutorial) — Analytics Vidhya (2026-07-27)