벤치마크
1.8달러 모델이 104달러 모델을 이겼다, 버그 105개로 돌려본 실측
실제 저장소에 숨긴 버그 105개를 프론티어 모델 10종에 돌린 결과, 33개를 고친 Luna는 1.8달러를 썼고 29개를 고친 Fable 5는 104달러를 썼습니다. 같은 모델이라도 추론 강도만 바꾸면 수정 개수가 13개에서 33개로 벌어졌고요. 개인이 만든 벤치마크가 드러낸 AI 코딩 비용의 실제 구조.
Written by

같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘
DeepSeek V4 Flash 0731이 지능 대비 비용에서 독보적 위치를 차지했습니다. 그런데 벤치마크 개선의 실체와, 같은 모델도 추론 강도 설정에 따라 결과가 크게 갈린다는 사이먼 윌리슨의 실험을 함께 짚어봅니다.
Written by

Kimi K3가 Fable을 베꼈다는 백악관 주장, 전문가들은 왜 고개를 젓나
개발자는 구분 못 했다는데, 백악관은 표절이라 말합니다. Kimi K3를 둘러싼 두 개의 다른 이야기.
Written by

Kimi K3, 프론트엔드 코드는 1위인데 어려운 수학은 39점
Kimi K3가 프론트엔드 코드 벤치마크는 1위, 고난도 수학은 39점에 그친 이유와 벤치마크 순위가 알려주지 않는 것을 다룹니다.
Written by

애플 신형 음성 인식, Whisper Small을 정확도와 속도 둘 다 앞섰다
애플 신형 음성 인식 API가 Whisper Small을 정확도·속도 모두에서 앞섰다는 첫 실측 벤치마크. 5,559개 발화로 검증한 결과를 정리합니다.
Written by

GPT-5.6 컨텍스트 창은 커졌는데, 내 사용한도는 왜 더 빨리 닳을까
GPT-5.6 Sol의 컨텍스트 창은 커졌는데 사용 한도는 왜 더 빨리 닳는지, 벤치마크 점수가 실제로 뭘 말해주고 뭘 말해주지 않는지 짚어봅니다.
Written by

토큰 단가 33% 싼 Sonnet 5, 실제 청구서는 3.7배 더 나왔다
마이크로소프트가 Claude Sonnet 4.6과 5를 150회 비교 실험. 토큰 단가는 싸도 실제 비용과 품질은 작업 종류에 따라 정반대로 갈렸습니다.
Written by

검색을 많이 시킬수록 정답률이 떨어지는 AI 에이전트의 역설
검색을 더 시켜도 정답률이 떨어지는 AI 검색 에이전트의 역설. DiscoBench 연구가 밝힌 진짜 약점은 검색력이 아니라 되묻는 능력입니다.
Written by

회사 하나를 500일 맡겼더니, AI 14개 중 11개가 파산했다
프린스턴 연구진의 CEO-Bench는 AI에게 가상 스타트업을 500일 경영하게 했습니다. 14개 모델 중 3개만 생존하고 단순 규칙 봇이 대부분을 이긴 결과를 소개합니다.
Written by

Qwen이 Opus급이라는 말의 진실, 직접 굴려본 창업자의 현실 보고서
1만 5천 달러 GPU로 로컬 Qwen을 1년 넘게 운영한 창업자의 실전 후기. 벤치마크 점수와 실제 신뢰도의 차이, 그리고 로컬 모델이 진짜 빛나는 용도를 짚습니다.
Written by
