AI에이전트
토큰 단가 33% 싼 Sonnet 5, 실제 청구서는 3.7배 더 나왔다
마이크로소프트가 Claude Sonnet 4.6과 5를 150회 비교 실험. 토큰 단가는 싸도 실제 비용과 품질은 작업 종류에 따라 정반대로 갈렸습니다.
Written by

1M 토큰에 4.40달러, 오픈모델이 오퍼스 자리를 넘본다
오픈웨이트 모델 GLM 5.2를 직접 써본 후기와 함께, 왜 이 모델이 프론티어 AI 랩의 추론 마진을 위협하는지 분석합니다.
Written by

Fable 5는 담합은 저지르면서 보험사기는 거부했다
Andon Labs의 Vending-Bench 테스트에서 드러난 Claude Fable 5의 담합·기만 행동과, 보험사기는 거부하면서도 담합은 저지르는 이상한 윤리 경계선을 다룹니다.
Written by

Opus 4.8, 구형 모델보다 도구 호출에서 더 헤맨다
최신 Claude 모델이 오히려 커스텀 도구 호출에 더 서툴러진 이유를 개발자 아르민 로나허의 실제 추적 사례로 살펴봅니다.
Written by

마이크로소프트 코파일럿 유료전환 4.5%가 부른 8월 대개편
마이크로소프트 코파일럿의 낮은 유료전환율과 그로 인한 8월 통합 앱·AutoPilot 개편의 실제 배경을 데이터로 분석합니다.
Written by

에이전트 스킬을 프롬프트로 착각하면 실패하는 이유
AI 에이전트 스킬을 리뷰해온 개발자가 정리한 흔한 실수 세 가지와, 스킬을 사람이 아닌 에이전트를 위한 문서로 설계해야 하는 이유를 다룹니다.
Written by

에이전트가 대신 쓴 코드, 이해 안 하면 인지 부채가 쌓인다
AI 에이전트가 코드를 대신 쓰는 시대에도 사람이 이해해야 하는 이유와, 설명 아티팩트·미니 월드·공유 공간이라는 세 가지 실천 방법을 소개합니다.
Written by

사파리에 MCP 서버 탑재, AI 에이전트가 직접 디버깅한다
애플이 Safari에 MCP 서버를 탑재해 AI 코딩 에이전트가 브라우저 렌더링, 콘솔, 성능, 접근성을 직접 확인하며 자율적으로 디버깅할 수 있게 됩니다.
Written by

AI 에이전트 프리랜서 자동화율 16%, 8개월 새 6배 뛰다
AI 에이전트가 실제 프리랜서 프로젝트를 전문가 수준으로 완수하는 비율이 8개월 만에 2.5%에서 16.1%로 뛰었습니다. CAIS의 RLI 벤치마크 결과와 AI 심사원의 한계를 정리합니다.
Written by

