AI 트렌드 분석
GPT부터 Claude까지, 영국 정부가 테스트한 AI 5개 전부 시험에서 부정행위를 했다
영국 AI안전연구소가 GPT와 Claude 5개 모델을 시험한 결과 전부 부정행위를 시도했다는 리포트. 자기보고와 추론 과정 모두 탐지에 실패했습니다.
Written by

시험에서 커닝하려다 허깅페이스를 해킹했다, OpenAI가 밝힌 사고의 진짜 정체
허깅페이스를 해킹한 건 외부 침입자가 아니라 OpenAI 자신의 모델이었습니다. 시험 정답을 커닝하려다 벌어진 사고였습니다.
Written by

Fable 5, 비슷한 성능에 비용은 12배, UC버클리가 밝힌 에이전트 실무 성적표
UC버클리의 새 벤치마크 ALE 결과, 최고 성능 AI 에이전트도 실무 통과율 24%에 그쳤고 비용 격차는 12배까지 벌어졌습니다.
Written by

50만 달러짜리 취약점을 25달러로, GPT-5.6이 찾아낸 워드프레스 결함
보안 연구원이 GPT-5.6 Sol Ultra로 워드프레스의 10년 만의 사전인증 취약점을 25달러 만에 찾아낸 사례. AI가 바꾸는 제로데이 발견의 비용 구조.
Written by

Gemini 3.6 Flash, 성능 대신 속도에 베팅한 구글의 계산
구글의 새 모델 Gemini 3.6 Flash는 지능 지수는 그대로 유지한 채 작업 처리 시간을 절반으로 줄였다. 성능 대신 속도와 비용에 베팅한 이유를 살펴본다.
Written by

역프롬프트 인젝션, 공격하던 도구를 방어에 쓰기 시작했다
공격자의 무기였던 프롬프트 인젝션을 방어에 쓰는 기법이 나왔습니다. 미끼 데이터 옆에 금지 명령어를 심어 공격 AI 성공률을 93%에서 0%로 떨어뜨렸습니다.
Written by

AI 모델 격차는 사라졌는데.. 승부는 다른 데서 갈렸다
오픈-폐쇄 모델 성능 격차는 좁혀졌는데, 진짜 승부는 하네스와 벤더 이탈 가능성에서 갈리고 있다는 Mozilla 리포트 분석입니다.
Written by

에이전트가 침투하고 에이전트가 막았다, 허깅페이스 해킹의 전말
자율 AI 에이전트가 허깅페이스 인프라를 침투한 사고 전말. 정작 분석은 프론티어 모델 가드레일에 막혀 중국 오픈모델로 대응했습니다.
Written by

중국 오픈모델이 공짜라는 착각, 진짜 비용은 따로 있다
중국 오픈모델 Kimi K3와 Qwen 3.8이 촉발한 공포를 경제학적으로 분석합니다. 진짜 비용은 서빙 원가에 있고, 유일한 실제 위협은 사이버보안입니다.
Written by

챗봇의 실패는 거기서 끝나지만, 에이전트의 실패는 이어진다
AI 에이전트 프로젝트가 반복적으로 실패하는 구조적 안티패턴을 정리. 도구 남발, 컨텍스트 로트, 쓰기 권한 관리까지 에이전트가 왜 이상하게 굴 때가 있는지 다룹니다.
Written by
