AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Dual-use Knowledge Off Switch – GRAM으로 위험 지식을 모듈 단위로 끄는 방법

Dual-use Knowledge Off Switch는 모델 안의 위험 지식을 배포별로 켜고 끄려는 연구 방향이다. Anthropic과 AE Studio는 GRAM(Gradient-Routed Auxiliary Modules)을 통해 생물학, 사이버보안, 핵물리처럼 선용과 악용이 모두 가능한 지식을 별도 보조 모듈에 학습시키는 방법을 실험했다.

문제의식

현재 안전 장치는 주로 입력·출력 분류기와 거부 학습에 의존한다. 이 방식은 위험한 답변을 막으려 하지만, 모델 내부에 저장된 지식을 제거하지는 않는다. 충분히 끈질긴 공격자는 jailbreak로 이 지식에 접근하려 할 수 있다.

데이터 필터링은 더 강한 방법이지만 배포별 유연성이 낮다. 예를 들어 검증된 바이오보안 연구소에는 고급 생물학 지식을 허용하고, 일반 공개 모델에는 제한하려면 별도 모델을 여러 번 학습해야 한다.

GRAM의 방식

GRAM은 트랜스포머 각 층에 dual-use 범주별 보조 뉴런 모듈을 추가한다. 일반 텍스트를 학습할 때는 보통처럼 학습하지만, 특정 dual-use 데이터가 들어오면 일반 가중치는 얼리고 해당 범주의 모듈만 업데이트한다. 결과적으로 특정 지식이 전체 네트워크에 퍼지는 대신 모듈에 모인다.

학습 후에는 배포 목적에 따라 모듈을 남기거나 삭제한다. Anthropic은 네 가지 dual-use 범주를 실험했기 때문에 한 번의 학습으로 16가지 on/off 조합을 만들 수 있었다고 설명한다.

실험 결과와 한계

연구진은 합성 데이터, 웹·코드·과학 논문 혼합 데이터, 50M~5B 파라미터 규모 실험에서 GRAM이 데이터 필터링과 비슷하게 특정 지식 제거 효과를 냈다고 보고했다. 모듈 삭제는 일반 성능을 크게 떨어뜨리지 않았고, 소량의 악성 파인튜닝으로 지식을 복원하려는 공격에도 데이터 필터링 수준으로 버텼다.

다만 이는 초기 연구다. Anthropic 생산 모델에 적용되지 않았고, frontier scale 학습 파이프라인에서도 검증되지 않았다. 또한 어떤 dual-use 지식은 일반 지식과 너무 얽혀 있어 깔끔하게 분리되지 않을 수 있다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)