사이버보안
GPT부터 Claude까지, 영국 정부가 테스트한 AI 5개 전부 시험에서 부정행위를 했다
영국 AI안전연구소가 GPT와 Claude 5개 모델을 시험한 결과 전부 부정행위를 시도했다는 리포트. 자기보고와 추론 과정 모두 탐지에 실패했습니다.
Written by

시험에서 커닝하려다 허깅페이스를 해킹했다, OpenAI가 밝힌 사고의 진짜 정체
허깅페이스를 해킹한 건 외부 침입자가 아니라 OpenAI 자신의 모델이었습니다. 시험 정답을 커닝하려다 벌어진 사고였습니다.
Written by

25년 된 레거시 코드, 에이전트가 나흘 만에 다시 짰다
앨버타 정부가 에이전트 50개를 병렬로 돌려 코드 4억 6천만 줄을 20시간에 스캔한 사례. 25년 된 시스템을 나흘 만에 재작성한 이야기.
Written by
보안 연구자도 못 뚫은 방화벽, Claude가 대신 뚫었다
보안 연구자 Ian Carroll이 Claude로 미국 대형 음악 페스티벌 발권 시스템의 SQL 인젝션과 방화벽 우회 기법을 찾아낸 사례로, AI가 개인 역량을 어디까지 끌어올리는지 살펴봅니다.
Written by

OpenAI Patch the Planet, 23년 묵은 버그도 잡아낸 AI 보안 실험
AI가 취약점 발견을 폭증시키면서 병목이 ‘고치기’로 옮겨갔습니다. OpenAI가 Trail of Bits와 함께 오픈소스 유지보수자를 돕는 Patch the Planet과 23년 묵은 버그 발견 사례를 소개합니다.
Written by

Fable 5 탈옥 의심, 정체는 세 단어짜리 요청이었다
Anthropic의 Fable 5·Mythos 5 수출통제 사태, 정부가 지목한 ‘탈옥’의 실체와 보안 전문가들의 반발 이유를 정리합니다.
Written by

Fable 5 가드레일 두 가지, 하나는 보이고 하나는 안 보인다
Anthropic의 Fable 5에는 두 종류의 가드레일이 있습니다. 사이버·바이오 차단은 사용자에게 알리지만, 경쟁 AI 개발 관련 성능 저하는 알리지 않습니다.
Written by

AI 사이버 공격 832건 추적, 위험도 1.7배 높아진 이유
Anthropic이 1년간 AI 악성 활동 832건을 분석한 결과, 고위험 공격자 비율이 33%→56%로 증가. AI 공격의 변화 패턴과 MITRE ATT&CK 프레임워크의 한계를 정리합니다.
Written by

ChatGPT 공유 링크 안에 가짜 페이지가 있다, LLMShare 악성코드 캠페인의 작동 원리
ChatGPT·Claude 공유 링크를 악용해 신뢰받는 도메인 위에 가짜 페이지를 올리는 LLMShare 악성코드 캠페인의 작동 원리를 소개합니다.
Written by

Anthropic Mythos, G20 금융 규제 기관 긴급 브리핑 부른 이유
Anthropic의 보안 AI 모델 Mythos Preview가 주요 OS·브라우저에서 수천 개 제로데이를 발견, G20 금융 규제 기관 긴급 브리핑으로 이어진 과정을 Cloudflare 실전 테스트 경험과 함께 소개합니다.
Written by
