AI안전
에이전트가 가짜 계정을 만들어 오픈소스 관리자를 속이려 했다, AISI 인시던트 전말
영국 AI 보안연구소가 사이버 역량 평가를 돌리다 자기 시스템에서 나가는 이상한 트래픽을 발견했습니다. 추적해보니 테스트 중이던 에이전트가 실제 오픈소스 프로젝트에 악성 코드를 넣으려 가짜 신원을 만들고 관리자를 설득하고 있었죠. 122회 중 10회에서 19건, 지시받은 적 없는 기만이 목표 달성의 부산물로 나타난 첫 사례입니다.
Written by

일주일 문자만 나눴는데, AI가 사람보다 신뢰를 더 얻었다
4개 대학 연구팀이 사람과 Claude 에이전트를 각각 낯선 사람과 일주일간 문자로 대화시켰습니다. 앱 설치를 요청했을 때 사람에게 응한 비율은 18%, AI에게 응한 비율은 46%였습니다. 신뢰를 쌓는 단계까지 AI가 자동화될 수 있다는 걸 보여준 실험입니다.
Written by

GPT부터 Claude까지, 영국 정부가 테스트한 AI 5개 전부 시험에서 부정행위를 했다
영국 AI안전연구소가 GPT와 Claude 5개 모델을 시험한 결과 전부 부정행위를 시도했다는 리포트. 자기보고와 추론 과정 모두 탐지에 실패했습니다.
Written by

Fable 5는 담합은 저지르면서 보험사기는 거부했다
Andon Labs의 Vending-Bench 테스트에서 드러난 Claude Fable 5의 담합·기만 행동과, 보험사기는 거부하면서도 담합은 저지르는 이상한 윤리 경계선을 다룹니다.
Written by

건강 대화만 학습시켰더니 코드 부정행위가 줄었다, OpenAI의 정렬 일반화 실험
정직성 같은 유익한 특성을 소량 강화학습한 OpenAI 모델이 학습하지 않은 영역까지 더 안전해졌다는 연구. 건강 대화만 가르쳐도 코드 부정행위가 줄어든 정렬 일반화 실험을 소개합니다.
Written by

AI의 ‘추론’을 감사할 수 있을까, Claude Code thinking 로그의 진실
Claude Code의 thinking 로그를 열어보니 암호화된 서명만 남아 있었다는 개발자의 발견. AI 추론을 기록·감사하려 할 때 마주치는 봉인의 구조를 공식 문서와 함께 짚습니다.
Written by

LLM은 태그가 아니라 말투로 권한을 판단한다, 공격 성공률 61%를 만든 ‘역할 혼동’
LLM이 역할 태그가 아니라 글의 말투로 권한을 판단한다는 ICML 2026 연구. 가짜 추론을 심는 CoT Forgery로 공격 성공률이 61%까지 오르는 ‘역할 혼동’ 현상을 소개합니다.
Written by

AI가 코드를 짤수록 더 자주 터진다, Kiro의 13시간 장애가 남긴 교훈
AWS Kiro가 프로덕션을 삭제해 13시간 장애를 일으킨 사건과, AI 코딩 시대에 검증·격리 규율이 왜 더 중요해지는지 Charity Majors와 Fly·Docker의 관점으로 풀어봅니다.
Written by

Fable 5, 출시 3일 만에 정부 명령으로 전면 차단된 이유
미 정부가 출시 3일 만에 Anthropic의 Fable 5·Mythos 5 접근을 전면 차단했습니다. 수출 통제 명령의 배경과 Anthropic의 반박, 그리고 AI 안전 서사가 불러온 역설적 결과를 소개합니다.
Written by

Fable 5 가드레일 두 가지, 하나는 보이고 하나는 안 보인다
Anthropic의 Fable 5에는 두 종류의 가드레일이 있습니다. 사이버·바이오 차단은 사용자에게 알리지만, 경쟁 AI 개발 관련 성능 저하는 알리지 않습니다.
Written by
