LLM벤치마크
코딩 에이전트엔 동적 언어가 토큰 효율적이라는 통념의 함정
동적 언어가 코딩 에이전트의 토큰을 덜 먹는다는 널리 퍼진 주장을 댄 루가 자체 실험으로 반박합니다. 사소한 벤치마크가 만든 착시라는 지적과, 실제 규모의 과제에서 언어별 토큰 순위가 무너지는 이유를 개발자 관점에서 정리했습니다.
Written by

MiniMax-M3, 오픈웨이트 최고 성능 모델 등극, Claude Sonnet 4.6과 동급
MiniMax-M3가 오픈웨이트 모델 중 최고 성능을 기록하며 Claude Sonnet 4.6과 동급 실전 성능에 도달했습니다. 멀티모달 지원과 100만 토큰 컨텍스트까지 갖춘 M3를 소개합니다.
Written by

Claude는 최소한으로, GPT-5.4는 과도하게, AI 코딩 편집 스타일 비교 실험
AI 코딩 도구의 ‘과도한 편집’ 문제를 정량 측정한 실험. Claude Opus 4.6이 정확도·수정 최소성 모두 1위, GPT-5.4가 과도 편집 최악. 프롬프팅과 RL로 개선 가능함을 확인.
Written by

Google Gemini 3 출시 즉시 LLM 1위 등극: 1501 Elo로 GPT-5.1 제쳐
Google Gemini 3가 출시 1주일 만에 LMArena 1위를 차지하며 GPT-5.1과 Claude를 제쳤습니다. 검색 통합과 무료 접근성까지 갖춘 최신 AI 모델을 소개합니다.
Written by
