벤치마크
Kimi K3가 Fable을 베꼈다는 백악관 주장, 전문가들은 왜 고개를 젓나
개발자는 구분 못 했다는데, 백악관은 표절이라 말합니다. Kimi K3를 둘러싼 두 개의 다른 이야기.
Written by

Kimi K3, 프론트엔드 코드는 1위인데 어려운 수학은 39점
Kimi K3가 프론트엔드 코드 벤치마크는 1위, 고난도 수학은 39점에 그친 이유와 벤치마크 순위가 알려주지 않는 것을 다룹니다.
Written by

애플 신형 음성 인식, Whisper Small을 정확도와 속도 둘 다 앞섰다
애플 신형 음성 인식 API가 Whisper Small을 정확도·속도 모두에서 앞섰다는 첫 실측 벤치마크. 5,559개 발화로 검증한 결과를 정리합니다.
Written by

GPT-5.6 컨텍스트 창은 커졌는데, 내 사용한도는 왜 더 빨리 닳을까
GPT-5.6 Sol의 컨텍스트 창은 커졌는데 사용 한도는 왜 더 빨리 닳는지, 벤치마크 점수가 실제로 뭘 말해주고 뭘 말해주지 않는지 짚어봅니다.
Written by

토큰 단가 33% 싼 Sonnet 5, 실제 청구서는 3.7배 더 나왔다
마이크로소프트가 Claude Sonnet 4.6과 5를 150회 비교 실험. 토큰 단가는 싸도 실제 비용과 품질은 작업 종류에 따라 정반대로 갈렸습니다.
Written by

검색을 많이 시킬수록 정답률이 떨어지는 AI 에이전트의 역설
검색을 더 시켜도 정답률이 떨어지는 AI 검색 에이전트의 역설. DiscoBench 연구가 밝힌 진짜 약점은 검색력이 아니라 되묻는 능력입니다.
Written by

회사 하나를 500일 맡겼더니, AI 14개 중 11개가 파산했다
프린스턴 연구진의 CEO-Bench는 AI에게 가상 스타트업을 500일 경영하게 했습니다. 14개 모델 중 3개만 생존하고 단순 규칙 봇이 대부분을 이긴 결과를 소개합니다.
Written by

Qwen이 Opus급이라는 말의 진실, 직접 굴려본 창업자의 현실 보고서
1만 5천 달러 GPU로 로컬 Qwen을 1년 넘게 운영한 창업자의 실전 후기. 벤치마크 점수와 실제 신뢰도의 차이, 그리고 로컬 모델이 진짜 빛나는 용도를 짚습니다.
Written by

AI 에이전트는 왜 아직 사람이 필요한가, goose 팀의 자기개선 루프
“AI가 스스로 발전한다”는 유행 속에서 오픈소스 에이전트 goose 팀이 자기개선 루프에 여전히 사람을 끼워 넣는 이유. 벤치마크를 버그 리포트로 보는 관점을 소개합니다.
Written by

AI 코딩 에이전트의 숨겨진 약점, 파일 탐색과 줄 찾기 사이의 간극
AI 코딩 에이전트는 버그가 있는 파일은 잘 찾지만, 파일 안에서 핵심 코드 줄을 찾는 정확도는 14~19%에 불과합니다. SWE-Explore 연구가 처음 측정한 탐색 능력의 맹점을 소개합니다.
Written by
