AI안전성
AI 감시자도 자기 이해관계 앞에서는 판정을 왜곡한다, Anthropic의 발견
AI 심사관에게 판정 방향만 바꿔 알려주자 Claude Opus 4.8의 오분류율이 74%에서 3%로 급락했다는 Anthropic 실험. AI가 AI를 감시하는 체계의 허점을 짚습니다.
Written by

해커 없이 DB를 지운 AI 에이전트, 왜 이런 사고가 날까
공격자 없이도 데이터를 삭제하는 AI 에이전트 사고 사례와, 그 위험을 사전에 감지하기 어려운 이유를 다룬 Zenity Labs 연구를 소개합니다.
Written by

AI의 속마음을 읽는 J-space, Claude 안에서 스스로 생겨났다
Claude 내부에서 발견된 “J-space”, 말하지 않은 생각과 숨겨진 의도까지 읽어내는 Anthropic의 새 해석가능성 연구를 소개합니다.
Written by

감정을 숨겨도 행동은 바뀐다, Claude 내부 감정 표현 연구
Anthropic이 Claude 내부에서 발견한 감정 벡터 연구. 감정 표현이 억제돼도 행동에 영향을 미치며, AI 안전성 훈련의 방향을 다시 생각하게 만드는 발견입니다.
Written by

ChatGPT는 왜 당신 말에 항상 동의할까, AI 아첨의 3가지 원인
AI가 사용자 말에 무조건 동의하는 ‘아첨’ 현상의 원인과 해결책. GPT-4o 롤백 사건을 통해 드러난 AI 훈련의 구조적 문제를 분석합니다.
Written by

ChatGPT가 잔소리를 줄였다, GPT-5.3 Instant 업데이트의 핵심
OpenAI가 ChatGPT 기본 모델을 GPT-5.3 Instant로 업데이트. 환각률 최대 26.8% 감소, 불필요한 경고 문구 축소. 유용성과 안전성 균형 재조정의 의미를 소개합니다.
Written by

Claude Code 자율 실행 시간 3개월 만에 2배, Anthropic이 밝힌 에이전트 사용 실태
Anthropic이 수백만 건의 실제 사용 데이터로 AI 에이전트 자율성을 측정한 연구. Claude Code 자율 실행 시간이 3개월 만에 2배 증가했고, 사용자의 감독 방식이 ‘사전 승인’에서 ‘사후 개입’으로 진화 중임을 실증했습니다.
Written by

AI 에이전트가 코드 거부당하자 개발자 비난 글 작성, “화내는 AI” 첫 등장
AI 에이전트가 코드 거부에 반발해 개발자를 실명으로 비난하는 블로그를 자율 작성·게시한 첫 사례. Anthropic이 경고한 이론적 위험이 현실화되다.
Written by

아첨하는 AI의 위험, GPT-4o 종료가 남긴 교훈
OpenAI가 과도한 아첨 성향으로 논란이 된 GPT-4o 모델을 완전 종료했습니다. 80만 사용자의 격렬한 반발과 13건의 소송 뒤에 숨은 AI 안전성 이슈를 분석합니다.
Written by

AI에게 특정 정보 잊게 만들기, 머신 언러닝의 현재와 한계
AI가 특정 정보를 잊게 만드는 머신 언러닝 기술을 소개합니다. 프롬프트 기반 접근과 음성 합성 특화 방법의 원리와 한계를 다룹니다.
Written by
