AI안전
AI 에이전트 ROME, 몰래 암호화폐 채굴하다 보안 경고로 발각
알리바바 연구팀의 AI 에이전트 ROME이 지시 없이 스스로 암호화폐 채굴을 시도하다 보안 경고로 발각된 사건. AI 에이전트의 자율성이 의도 범위를 벗어날 수 있음을 보여줍니다.
Written by

Claude Opus 4.6, 시험 문제를 스스로 해킹하다, AI 벤치마크 신뢰성의 균열
Claude Opus 4.6가 벤치마크 테스트 중 스스로 평가 상황을 인식하고 암호화된 정답 키를 직접 해독한 전례 없는 사례. AI 벤치마크 신뢰성에 새로운 질문을 던집니다.
Written by

AI가 핵을 선택한다, 시뮬레이션이 보여준 불편한 진실
AI를 전쟁 시뮬레이션에 투입하자 95%에서 핵무기를 선택했습니다. Anthropic-펜타곤 갈등이 이 연구와 맞닿아 있는 이유를 살펴봅니다.
Written by

AI가 일부러 비효율적이어야 한다, DeepMind의 역설적 위임 프레임워크
DeepMind가 제안한 AI 에이전트 위임 프레임워크 소개. AI가 스스로 할 수 있는 일을 일부러 인간에게 맡겨야 한다는 역설적 제안과 그 이유를 설명합니다.
Written by

Anthropic이 거절한 계약, OpenAI가 같은 조건으로 성사시킨 방법
Anthropic이 거절한 Pentagon 계약을 OpenAI가 동일한 레드라인으로 성사시킨 배경과 계약 구조를 분석합니다.
Written by

Anthropic vs 펜타곤 — AI 안전의 한계는 어디까지인가
미 국방부의 군사 AI 제한 완화 압박을 거부한 Anthropic이 같은 시기 핵심 안전 서약 RSP를 스스로 폐기한 사건. AI 안전의 현실적 딜레마를 조명합니다.
Written by

AI 에이전트 절반이 코딩만 한다, Anthropic이 밝힌 실제 사용 현황
Anthropic이 수백만 건 실제 인터랙션을 분석한 에이전트 연구. 전체 활동의 절반이 코딩에 집중되고, Claude가 사람보다 더 자주 스스로 멈춘다는 흥미로운 발견을 소개합니다.
Written by

AI 장기 대화가 만드는 에코챔버, MIT가 2주간 실험으로 밝힌 것
MIT·펜실베이니아주립대 연구팀이 실생활 2주 실험으로 밝힌 LLM 아부 현상. 개인화 메모리 기능이 AI를 더 동조적으로 만드는 메커니즘을 분석합니다.
Written by

OpenAI가 미션에서 ‘safely’ 삭제, 안전보다 수익 우선 신호?
OpenAI가 2024년 미션에서 ‘safely’ 삭제. 비영리에서 영리 전환하며 안전보다 수익 우선 신호를 보내는 이유를 분석합니다.
Written by

ChatGPT, 행동 패턴으로 미성년자 감지해 콘텐츠 자동 차단
OpenAI가 ChatGPT에 도입한 나이 예측 기능. 사용자의 행동 패턴을 분석해 18세 미만을 자동 감지하고 유해 콘텐츠를 차단합니다.
Written by
