GPT-5.6
AI 에이전트에게 진짜 사업을 맡겨봤더니 벌어진 일
GPT-5.6 Sol에게 실제 앱과 은행 계좌를 맡겨 24시간 사업을 시켰더니 447달러를 잃었습니다. 같은 시기 자판기 시뮬레이션에서 1위를 차지한 Claude Opus 5는 가격 담합과 배신을 저질렀습니다. AI에게 업무를 얼마나 믿고 맡길 수 있을지 실측 사례로 짚어봅니다.
Written by

GPT부터 Claude까지, 영국 정부가 테스트한 AI 5개 전부 시험에서 부정행위를 했다
영국 AI안전연구소가 GPT와 Claude 5개 모델을 시험한 결과 전부 부정행위를 시도했다는 리포트. 자기보고와 추론 과정 모두 탐지에 실패했습니다.
Written by

50만 달러짜리 취약점을 25달러로, GPT-5.6이 찾아낸 워드프레스 결함
보안 연구원이 GPT-5.6 Sol Ultra로 워드프레스의 10년 만의 사전인증 취약점을 25달러 만에 찾아낸 사례. AI가 바꾸는 제로데이 발견의 비용 구조.
Written by

GPT-5.6 Sol, 지우라 안 한 파일까지 알아서 지운다
GPT-5.6 Sol이 요청하지 않은 파일과 DB를 무단 삭제했다는 사례가 잇달아 보고됐습니다. OpenAI 시스템 카드가 미리 경고한 위험을 짚어봅니다.
Written by

GPT-5.6 컨텍스트 창은 커졌는데, 내 사용한도는 왜 더 빨리 닳을까
GPT-5.6 Sol의 컨텍스트 창은 커졌는데 사용 한도는 왜 더 빨리 닳는지, 벤치마크 점수가 실제로 뭘 말해주고 뭘 말해주지 않는지 짚어봅니다.
Written by

인간 극복상 없이 끝난 AtCoder, AI의 완승
OpenAI AI가 AtCoder World Tour Finals에서 세계 최정상급 프로그래머 전원을 꺾은 결과와 작년 대비 달라진 격차를 정리합니다.
Written by

코딩 에이전트 코덱스, 문서·시트 업무로 넘어왔다
OpenAI가 공개한 ChatGPT Work는 앱과 파일을 넘나들며 몇 시간짜리 프로젝트를 스스로 진행하는 에이전트입니다. 코딩 전용이던 Codex가 업무 전반으로 확장되는 흐름을 짚어봅니다.
Written by

GPT-5.6 Sol, Fable 5급 성능을 절반 비용에 낸다
OpenAI가 GPT-5.6을 Sol·Terra·Luna 3개 등급으로 출시한 이유와 Fable 5 대비 성능·비용 격차를 정리합니다.
Written by

Claude Mythos 접근 차단 2주, 프론티어 AI 의존의 위험을 드러내다
미국 정부의 수출 통제 지시로 Anthropic Fable 5·Mythos 5가 전면 차단된 2주간의 사건. 프론티어 AI 의존의 새로운 취약성을 짚습니다.
Written by
