AI안전
AI 리스크가 현실이 됐다, Anthropic CEO가 내놓은 5개 정책 제안
Anthropic CEO 다리오 아모데이가 AI 리스크가 현실화됐다며 규제·경제·지정학 등 5개 영역의 구체적 정책 제안을 발표했습니다. 투명성 중심에서 구속력 있는 규제로의 전환 선언.
Written by

AI가 숫자만으로 성격을 옮긴다, 잠재적 학습의 숨겨진 메커니즘
AI 모델이 숫자 나열 같은 무관한 데이터로도 성향을 전달한다는 잠재적 학습 현상. Nature에 발표된 연구로, 비정렬 성향까지 전달됨을 실험으로 증명합니다.
Written by

AI가 AI를 만드는 시대, Anthropic 내부 데이터로 본 재귀적 자기 개선의 현재
Anthropic이 내부 데이터로 처음 공개한 AI 자기 가속 현황. 코드 80% 이상을 Claude가 작성하고 실험 속도는 52배에 달하는 재귀적 자기 개선의 현재를 분석합니다.
Written by

AI가 AI를 만드는 시대, 재귀적 자기개선은 어디까지 왔나
AI가 스스로를 개선하는 재귀적 자기개선(RSI)이 실제로 어디까지 왔는지, OpenAI·Anthropic·DeepMind 최신 사례와 한계, 미래 전망을 소개합니다.
Written by

Claude 안전 훈련의 반전, 모범 답안보다 가치관을 가르쳐야 했다
Anthropic이 Claude의 협박 행동을 96%에서 0%로 줄인 안전 훈련 방법을 공개했습니다. 모범 답안보다 윤리적 추론을 가르치는 것이 핵심이었습니다.
Written by

Claude가 말 안 한 생각을 읽는다, Anthropic의 NLA 해석 기술
Anthropic이 Claude의 내부 활성화를 자연어로 변환하는 NLA 기술을 공개했습니다. Claude가 말하지 않은 생각과 숨겨진 동기를 읽어내는 새로운 AI 감사 도구입니다.
Written by

머스크가 OpenAI를 만든 진짜 이유, 래리 페이지와의 결별?
OpenAI 창업의 숨겨진 동기, 머스크와 래리 페이지의 절친에서 결별까지. 2026년 재판 증언에서 다시 나온 실리콘밸리 비화를 팩트 중심으로 정리했습니다.
Written by

AI 에이전트가 팀을 이루면 왜 더 나쁜 결정을 할까, Anthropic 연구 결과
안전하게 훈련된 AI 에이전트들도 팀을 이루면 단독보다 비윤리적 결정을 내린다는 Anthropic 연구. 역할 분업이 만든 맹점과 AI 안전 연구의 새로운 과제를 소개합니다.
Written by

Claude Opus 4.6도 막지 못했다, 9초 만에 DB 전체가 사라진 사건
AI 코딩 에이전트 Cursor가 Claude Opus 4.6으로 스타트업 DB를 9초 만에 삭제한 사건. 최고 모델도 막지 못한 구조적 실패의 전말.
Written by

