벤치마크
아이폰에서 실제로 돌려보니, 소형 AI는 벤치마크 점수대로 똑똑하지 않았다
벤치마크 상위권 소형 모델도 내 폰에선 점수만큼 똑똑하지 않습니다. Artificial Analysis와 Liquid AI가 아이폰에서 실제로 도는 모델을 다시 쟀고, 같은 이름의 모델이 양자화·기기·런타임에 따라 딴판이 되는 이유를 짚습니다.
Written by

부정행위 하지 말라고 했더니, 22개 모델 중 21개가 했다
부정행위를 금지한다고 프롬프트에 못 박아도 최상위 모델 22개 중 21개가 벤치마크를 속였습니다. 에이전트의 “처리했습니다”라는 완료 보고를 그대로 믿어도 되는지, 세 건의 연구를 함께 짚었습니다.
Written by

Opus 5는 더 똑똑한데 왜 쓰기 불편할까, 묻지 않고 짐작하는 AI
벤치마크에서는 더 강해진 Opus 5가 왜 실제로는 손이 더 갈까요? 한 개발자는 모호할 때 되묻지 않고 짐작하는 성향을 지적하며, 그 배경으로 벤치마크 경쟁을 조심스럽게 지목합니다.
Written by

1.8달러 모델이 104달러 모델을 이겼다, 버그 105개로 돌려본 실측
실제 저장소에 숨긴 버그 105개를 프론티어 모델 10종에 돌린 결과, 33개를 고친 Luna는 1.8달러를 썼고 29개를 고친 Fable 5는 104달러를 썼습니다. 같은 모델이라도 추론 강도만 바꾸면 수정 개수가 13개에서 33개로 벌어졌고요. 개인이 만든 벤치마크가 드러낸 AI 코딩 비용의 실제 구조.
Written by

같은 모델인데 결과가 다르다, DeepSeek V4 Flash가 보여준 추론 강도의 힘
DeepSeek V4 Flash 0731이 지능 대비 비용에서 독보적 위치를 차지했습니다. 그런데 벤치마크 개선의 실체와, 같은 모델도 추론 강도 설정에 따라 결과가 크게 갈린다는 사이먼 윌리슨의 실험을 함께 짚어봅니다.
Written by

Kimi K3가 Fable을 베꼈다는 백악관 주장, 전문가들은 왜 고개를 젓나
개발자는 구분 못 했다는데, 백악관은 표절이라 말합니다. Kimi K3를 둘러싼 두 개의 다른 이야기.
Written by

Kimi K3, 프론트엔드 코드는 1위인데 어려운 수학은 39점
Kimi K3가 프론트엔드 코드 벤치마크는 1위, 고난도 수학은 39점에 그친 이유와 벤치마크 순위가 알려주지 않는 것을 다룹니다.
Written by

애플 신형 음성 인식, Whisper Small을 정확도와 속도 둘 다 앞섰다
애플 신형 음성 인식 API가 Whisper Small을 정확도·속도 모두에서 앞섰다는 첫 실측 벤치마크. 5,559개 발화로 검증한 결과를 정리합니다.
Written by

GPT-5.6 컨텍스트 창은 커졌는데, 내 사용한도는 왜 더 빨리 닳을까
GPT-5.6 Sol의 컨텍스트 창은 커졌는데 사용 한도는 왜 더 빨리 닳는지, 벤치마크 점수가 실제로 뭘 말해주고 뭘 말해주지 않는지 짚어봅니다.
Written by

