AI 지능 곡선이 평평해진다, 격차는 모델이 아니라 사람에서 갈린다
지금까지는 새 모델이 나올 때마다 더 똑똑해졌고, 우리는 그 차이를 분명히 느꼈습니다. 그런데 어떤 사람들은 이제 Opus 4.8과 Fable 5의 차이를 잘 모르겠다고 말합니다. 발전이 멈춰서가 아닙니다. 곡선이 평평해 보이는 데는 전혀 다른 이유가 있습니다. 30년 넘게 업계에 몸담은 개발자 Steve Yegge가 “The Flat Curve Society”라는 글을 발표했습니다. 핵심 주장은 이렇습니다. AI의 능력은 앞으로도 기하급수적으로…
Written by
LLM은 태그가 아니라 말투로 권한을 판단한다, 공격 성공률 61%를 만든 ‘역할 혼동’
LLM이 역할 태그가 아니라 글의 말투로 권한을 판단한다는 ICML 2026 연구. 가짜 추론을 심는 CoT Forgery로 공격 성공률이 61%까지 오르는 ‘역할 혼동’ 현상을 소개합니다.
Written by
프롬프트는 문제가 없었다, MS가 찾은 LLM 신뢰성의 진짜 해법
LLM 출력이 형식은 완벽한데 내용이 비는 문제를, MS가 결정론적 추출과 AI 추론을 분리해 해결한 사례. 프롬프트가 아닌 책임 경계가 답이었습니다.
Written by
Qwen이 Opus급이라는 말의 진실, 직접 굴려본 창업자의 현실 보고서
1만 5천 달러 GPU로 로컬 Qwen을 1년 넘게 운영한 창업자의 실전 후기. 벤치마크 점수와 실제 신뢰도의 차이, 그리고 로컬 모델이 진짜 빛나는 용도를 짚습니다.
Written by
무료 ChatGPT가 의사 답변보다 높은 점수를 받았다, GPT-5.5 Instant 건강 업그레이드
무료 ChatGPT의 GPT-5.5 Instant가 의사 작성 답변보다 높은 점수를 받았다는 OpenAI 발표. 성능 개선의 실체와 자체 평가라는 한계를 함께 짚습니다.
Written by
AI 에이전트는 왜 아직 사람이 필요한가, goose 팀의 자기개선 루프
“AI가 스스로 발전한다”는 유행 속에서 오픈소스 에이전트 goose 팀이 자기개선 루프에 여전히 사람을 끼워 넣는 이유. 벤치마크를 버그 리포트로 보는 관점을 소개합니다.
Written by
Claude가 신분증을 요구하기 시작했다, AI 챗봇에 들어온 신원 인증의 의미
Anthropic이 7월 8일부터 Claude 소비자 사용자에게 정부 신분증과 얼굴 인증을 요구합니다. 생체정보 수집과 수출통제 배경, 개인 사용자에게 갖는 의미를 짚습니다.
Written by
OpenAI Codex, 프롬프트 대신 시연으로 AI를 가르치는 Record & Replay
OpenAI가 macOS용 Codex에 Record & Replay를 추가했습니다. 작업을 한 번 시연하면 재사용 가능한 스킬로 만들어 반복하는 기능으로, 프롬프트 대신 시연으로 AI를 가르치는 방식을 소개합니다.
Written by
같은 작업에 토큰을 더 쓰는 AI, Copilot이 매 턴 반복 비용을 줄인 방법
GitHub Copilot이 프롬프트 캐싱과 도구 검색, Auto 모델 라우팅으로 매 턴 반복되는 토큰 비용을 줄인 방법. 사용량 기반 과금 시대에 효율의 정의가 어떻게 바뀌는지 짚어봅니다.
Written by
엔지니어 99%가 매일 AI를 쓰는 회사에서 벌어진 일, 스포티파이가 본 진짜 병목
엔지니어 99%가 AI 코딩 도구를 쓰는 스포티파이에서 병목이 코딩에서 의사결정으로 옮겨간 이야기. 백그라운드 에이전트 Honk와 ‘에이전트를 위한 개발자 경험’을 소개합니다.
Written by









