AI 인사이트
Opus 4.8, 구형 모델보다 도구 호출에서 더 헤맨다
최신 Claude 모델이 오히려 커스텀 도구 호출에 더 서툴러진 이유를 개발자 아르민 로나허의 실제 추적 사례로 살펴봅니다.
Written by

에이전트가 대신 쓴 코드, 이해 안 하면 인지 부채가 쌓인다
AI 에이전트가 코드를 대신 쓰는 시대에도 사람이 이해해야 하는 이유와, 설명 아티팩트·미니 월드·공유 공간이라는 세 가지 실천 방법을 소개합니다.
Written by

스택오버플로우 질문 20만→3천, 우리는 생각을 멈췄나
스택오버플로우 질문 수가 8년 만에 20만 건에서 3천 건으로 급감했습니다. AI에 생각을 아웃소싱하면서 우리 뇌와 코드에 실제로 무슨 일이 일어나는지, 뇌파 연구와 코드품질 데이터로 살펴봅니다.
Written by

AI 에이전트 프리랜서 자동화율 16%, 8개월 새 6배 뛰다
AI 에이전트가 실제 프리랜서 프로젝트를 전문가 수준으로 완수하는 비율이 8개월 만에 2.5%에서 16.1%로 뛰었습니다. CAIS의 RLI 벤치마크 결과와 AI 심사원의 한계를 정리합니다.
Written by

보안 연구자도 못 뚫은 방화벽, Claude가 대신 뚫었다
보안 연구자 Ian Carroll이 Claude로 미국 대형 음악 페스티벌 발권 시스템의 SQL 인젝션과 방화벽 우회 기법을 찾아낸 사례로, AI가 개인 역량을 어디까지 끌어올리는지 살펴봅니다.
Written by

챗봇에서 에이전트로, 위임하고 검수하는 방식이 온다
챗봇에게 묻던 시대에서 에이전트에게 맡기고 관리자처럼 검수하는 시대로. 성패를 가르는 건 직군이 아니라 전문성이라는 발견을 소개합니다.
Written by

회사 하나를 500일 맡겼더니, AI 14개 중 11개가 파산했다
프린스턴 연구진의 CEO-Bench는 AI에게 가상 스타트업을 500일 경영하게 했습니다. 14개 모델 중 3개만 생존하고 단순 규칙 봇이 대부분을 이긴 결과를 소개합니다.
Written by

AI가 만든 트래픽은 어디로 사라지나, Similarweb이 추적한 ‘AI 인용의 진짜 효과’
AI 답변에 인용되면 실제 방문이 2.5배 늘지만, 그 트래픽은 분석 도구에 ‘검색’으로 잡힙니다. Similarweb이 클릭스트림으로 추적한 AI 인용의 진짜 효과.
Written by

로컬 LLM으로 코딩하는 시대, Qwen 3.6 27B가 노트북에서 프런티어급에 닿다
Qwen 3.6 27B가 노트북에서 프런티어급 코딩에 근접했습니다. 모델 성능과 하니스 효율, 로컬 전환의 의미를 실무자 관점으로 짚습니다.
Written by

프롬프트 인젝션 6000번 공격, AI 에이전트가 다 막아낸 실험
2,000명이 6,000번 공격했지만 비밀은 새지 않았다. Claude Opus 4.6 기반 AI 비서를 대상으로 한 프롬프트 인젝션 실험과, 개인 사용자가 읽어야 할 의미를 짚습니다.
Written by
