AI투명성
Claude 출력에 보이지 않는 워터마크가 박힌다, 무엇이 붙고 어떻게 확인하나
2026년 8월부터 새 Claude 모델이 생성하는 텍스트에 보이지 않는 워터마크가, 파일에는 서명된 출처 메타데이터가 전 제품에 걸립니다. 무엇이 박히고 편집하면 지워지는지, 검출 도구와 그 한계를 개인 사용자 관점에서 정리합니다.
Written by

생명공학 자료 찾다 막힌 AI, 안전장치 기준은 어디에도 없었다
생명공학 자료를 조사하다 세션이 통째로 막힌 사용자가 있습니다. Anthropic은 정책 입장을 상세히 공개했지만, 정작 무엇이 사용자를 막았는지는 어디에도 적혀 있지 않습니다. 안전장치의 기준이 비공개인 채로 매일 작동하고 있다는 이야기.
Written by

AI 추론 과정의 절반을 지워도 답은 그대로 나온다
AI가 답을 내기 전 보여주는 “생각의 사슬” 중 상당수는 실제 답변과 인과관계가 없다는 연구 결과가 나왔습니다. 절반을 지워도 성능이 유지된다는 실험을 통해, AI 추론 과정을 얼마나 믿어야 할지 짚어봅니다.
Written by

말투 하나까지 설계됐다, Claude Fable 5 시스템 프롬프트가 드러낸 것들
유출된 Claude Fable 5 시스템 프롬프트가 보여준 것들. 메모리를 티 내지 않는 이유부터 거절 규칙까지, AI의 말투가 얼마나 세밀하게 설계됐는지 짚어봅니다.
Written by

ChatGPT, 검색하는 질문과 안 하는 질문이 따로 있다
ChatGPT 네트워크 트래픽 분석으로 밝혀진 질문별 검색 분기, 인용 메커니즘, 개인화 작동 방식을 다룹니다.
Written by

건강 대화만 학습시켰더니 코드 부정행위가 줄었다, OpenAI의 정렬 일반화 실험
정직성 같은 유익한 특성을 소량 강화학습한 OpenAI 모델이 학습하지 않은 영역까지 더 안전해졌다는 연구. 건강 대화만 가르쳐도 코드 부정행위가 줄어든 정렬 일반화 실험을 소개합니다.
Written by

AI의 ‘추론’을 감사할 수 있을까, Claude Code thinking 로그의 진실
Claude Code의 thinking 로그를 열어보니 암호화된 서명만 남아 있었다는 개발자의 발견. AI 추론을 기록·감사하려 할 때 마주치는 봉인의 구조를 공식 문서와 함께 짚습니다.
Written by

Fable 5 숨겨진 가드레일, Anthropic이 결국 사과하고 번복했습니다
Anthropic이 Fable 5의 숨겨진 가드레일 정책을 번복하고 공개 사과했습니다. 빠른 출시를 위해 투명성을 양보한 이유와 AI 도구 신뢰의 문제를 짚습니다.
Written by

AI가 만든 이미지, 이제 구별할 수 있다, OpenAI 출처 증명 3중 시스템 공개
OpenAI가 AI 생성 이미지를 식별하는 3중 시스템을 공개했습니다. C2PA 표준, SynthID 워터마킹, 공개 검증 툴의 작동 방식과 의미를 소개합니다.
Written by

Claude가 말 안 한 생각을 읽는다, Anthropic의 NLA 해석 기술
Anthropic이 Claude의 내부 활성화를 자연어로 변환하는 NLA 기술을 공개했습니다. Claude가 말하지 않은 생각과 숨겨진 동기를 읽어내는 새로운 AI 감사 도구입니다.
Written by
