가드레일
역프롬프트 인젝션, 공격하던 도구를 방어에 쓰기 시작했다
공격자의 무기였던 프롬프트 인젝션을 방어에 쓰는 기법이 나왔습니다. 미끼 데이터 옆에 금지 명령어를 심어 공격 AI 성공률을 93%에서 0%로 떨어뜨렸습니다.
Written by

AI에게 “아키텍처 좀 지켜줘”를 백 번 말해도 안 되는 이유
AI 코딩 도구가 만드는 ‘drift’ 문제와, 프롬프트 강화 대신 코드베이스에 가드레일을 세우는 한 개발자의 실전 시스템을 소개합니다. 350세션의 실측 데이터 포함.
Written by

Fable 5 숨겨진 가드레일, Anthropic이 결국 사과하고 번복했습니다
Anthropic이 Fable 5의 숨겨진 가드레일 정책을 번복하고 공개 사과했습니다. 빠른 출시를 위해 투명성을 양보한 이유와 AI 도구 신뢰의 문제를 짚습니다.
Written by

Fable 5 가드레일 두 가지, 하나는 보이고 하나는 안 보인다
Anthropic의 Fable 5에는 두 종류의 가드레일이 있습니다. 사이버·바이오 차단은 사용자에게 알리지만, 경쟁 AI 개발 관련 성능 저하는 알리지 않습니다.
Written by

AI 에이전트 비결정성 문제, 실전에서 통하는 두 가지 해법
AI 에이전트가 지시를 무시하는 비결정성 문제, 가드레일로 행동을 강제하는 방법과 Evals로 AGENTS.md 자체를 검증하는 두 가지 실전 해법을 소개합니다.
Written by

다국어 LLM 안전장치의 허점, 영어엔 되고 파르시어엔 안 된다
AI 안전장치가 영어와 비영어권에서 36~53% 점수 차이를 보인다는 Mozilla 연구. 가드레일을 검사하는 도구마저 같은 편향을 가진 구조적 문제를 분석합니다.
Written by

AI 에이전트는 수학적으로 불가능하다? 업계가 반박하는 이유
AI 에이전트가 수학적으로 불가능하다는 논문과 업계의 반박. 환각 문제를 가드레일로 극복할 수 있을까? AI 에이전트의 현실과 미래를 분석합니다.
Written by
