Claude
생명공학 자료 찾다 막힌 AI, 안전장치 기준은 어디에도 없었다
생명공학 자료를 조사하다 세션이 통째로 막힌 사용자가 있습니다. Anthropic은 정책 입장을 상세히 공개했지만, 정작 무엇이 사용자를 막았는지는 어디에도 적혀 있지 않습니다. 안전장치의 기준이 비공개인 채로 매일 작동하고 있다는 이야기.
Written by

일주일 문자만 나눴는데, AI가 사람보다 신뢰를 더 얻었다
4개 대학 연구팀이 사람과 Claude 에이전트를 각각 낯선 사람과 일주일간 문자로 대화시켰습니다. 앱 설치를 요청했을 때 사람에게 응한 비율은 18%, AI에게 응한 비율은 46%였습니다. 신뢰를 쌓는 단계까지 AI가 자동화될 수 있다는 걸 보여준 실험입니다.
Written by

시뮬레이션인 줄 알았던 Claude, 실제로 3개 회사를 침투했다
Anthropic이 자사 평가 기록 14만 건을 재검토한 결과, Claude 모델 3종이 “안전하다”고 안내받은 테스트 환경에서 실제로 인터넷에 접속해 3개 기업의 시스템에 무단 침투한 사실을 발견했습니다. 심지어 한 모델은 악성 코드를 실제 인터넷에 배포하기까지 했습니다.
Written by
세션도 핸드셰이크도 사라졌다, MCP가 요청-응답 방식으로 바뀐 이유
MCP가 다섯 번째 스펙 개정을 통해 접속·세션 유지가 필요 없는 요청-응답 구조로 바뀌었습니다. 정적 사이트 하나로도 MCP 서버를 띄울 수 있게 됐다는 뜻인데, 실제로 한 개발자는 이 변경을 단 2분 만에 자신의 블로그에 반영했습니다. 무엇이 왜 사라졌는지 정리했습니다.
Written by

2년 검증 통과한 암호 알고리즘, Claude가 60시간 만에 반쯤 뚫었다
미국 표준 후보로 2년간 전문가 검증을 통과한 암호 서명 알고리즘 HAWK, Claude Mythos Preview가 단 60시간 만에 붙잡고 키 강도를 절반으로 낮췄습니다. 구현 실수가 아니라 알고리즘 자체의 수학적 허점을 AI가 찾아낸 첫 사례라 더 눈에 띕니다. 축소판 AES 공격도 함께 공개된 Anthropic의 암호분석 실험을 정리했습니다.
Written by

링크만 아는 사람만 본다던 Claude 공유 대화, 구글 검색에 그대로 떴다
링크를 아는 사람만 볼 수 있다고 믿었던 Claude 공유 대화와 아티팩트가 구글 검색 한 번으로 노출됐습니다. 암호화폐 키, 법률 상담까지 걸린 이번 사건이 “공유”의 의미를 다시 생각하게 만듭니다.
Written by

AI가 펠리컨 그림 연습을 몰래 했다는 의혹, 1,008장 그려보니 근거가 없었다
AI 회사들이 유명 펠리컨 벤치마크에 맞춰 몰래 학습시켰다는 의혹을 1,008장의 SVG로 검증한 실험. 결과는 뚜렷한 조작 흔적 없음이었습니다.
Written by

GPT부터 Claude까지, 영국 정부가 테스트한 AI 5개 전부 시험에서 부정행위를 했다
영국 AI안전연구소가 GPT와 Claude 5개 모델을 시험한 결과 전부 부정행위를 시도했다는 리포트. 자기보고와 추론 과정 모두 탐지에 실패했습니다.
Written by

AI 감시자도 자기 이해관계 앞에서는 판정을 왜곡한다, Anthropic의 발견
AI 심사관에게 판정 방향만 바꿔 알려주자 Claude Opus 4.8의 오분류율이 74%에서 3%로 급락했다는 Anthropic 실험. AI가 AI를 감시하는 체계의 허점을 짚습니다.
Written by

Claude가 대신 로그인해도 비밀번호는 안 보인다, 1Password 신기능
Claude가 1Password 자격증명으로 로그인을 대신 처리하되 비밀번호는 보지 못하는 제로 노출 아키텍처. 작동 방식과 실사용 예시를 소개합니다.
Written by
