벤치마크
토큰 단가 33% 싼 Sonnet 5, 실제 청구서는 3.7배 더 나왔다
마이크로소프트가 Claude Sonnet 4.6과 5를 150회 비교 실험. 토큰 단가는 싸도 실제 비용과 품질은 작업 종류에 따라 정반대로 갈렸습니다.
Written by

검색을 많이 시킬수록 정답률이 떨어지는 AI 에이전트의 역설
검색을 더 시켜도 정답률이 떨어지는 AI 검색 에이전트의 역설. DiscoBench 연구가 밝힌 진짜 약점은 검색력이 아니라 되묻는 능력입니다.
Written by

회사 하나를 500일 맡겼더니, AI 14개 중 11개가 파산했다
프린스턴 연구진의 CEO-Bench는 AI에게 가상 스타트업을 500일 경영하게 했습니다. 14개 모델 중 3개만 생존하고 단순 규칙 봇이 대부분을 이긴 결과를 소개합니다.
Written by

Qwen이 Opus급이라는 말의 진실, 직접 굴려본 창업자의 현실 보고서
1만 5천 달러 GPU로 로컬 Qwen을 1년 넘게 운영한 창업자의 실전 후기. 벤치마크 점수와 실제 신뢰도의 차이, 그리고 로컬 모델이 진짜 빛나는 용도를 짚습니다.
Written by

AI 에이전트는 왜 아직 사람이 필요한가, goose 팀의 자기개선 루프
“AI가 스스로 발전한다”는 유행 속에서 오픈소스 에이전트 goose 팀이 자기개선 루프에 여전히 사람을 끼워 넣는 이유. 벤치마크를 버그 리포트로 보는 관점을 소개합니다.
Written by

AI 코딩 에이전트의 숨겨진 약점, 파일 탐색과 줄 찾기 사이의 간극
AI 코딩 에이전트는 버그가 있는 파일은 잘 찾지만, 파일 안에서 핵심 코드 줄을 찾는 정확도는 14~19%에 불과합니다. SWE-Explore 연구가 처음 측정한 탐색 능력의 맹점을 소개합니다.
Written by

Gemini 3.5 Flash, 경쟁 모델 4배 빠르지만 실질 비용은 전작의 5배
구글 I/O 2026에서 공개된 Gemini 3.5 Flash 분석. 에이전트 전용 설계로 성능은 올랐지만 실질 비용은 전작 대비 5.5배 오른 배경을 설명합니다.
Written by

Qwen3.6-Max, 코딩 벤치마크 1위지만 오픈소스는 없다, Alibaba의 전략 전환
Alibaba가 Qwen 최초의 클로즈드 웨이트 모델 Qwen3.6-Max-Preview를 출시했습니다. 코딩 벤치마크 6개 1위, 오픈소스 포기의 의미를 분석합니다.
Written by

AI 에이전트 스킬, 벤치마크 성능의 절반도 현실에서 안 나온다
AI 에이전트 스킬이 벤치마크와 달리 현실 조건에서 성능 이점이 거의 사라진다는 연구 결과. 34,000개 실제 스킬로 테스트한 UC Santa Barbara·MIT 연구팀의 분석.
Written by

SWE-bench 통과한 AI 코드, 실제 개발자에겐 절반이 불합격
METR 연구 결과, AI가 SWE-bench를 통과한 코드의 절반이 실제 개발자 심사에서 탈락했습니다. 벤치마크 점수와 실무 유용성 사이의 격차를 분석합니다.
Written by
