AI 인사이트
LLM 에이전트 시대, 프로토타입을 완성품으로 착각하는 개발자들
LLM 에이전트가 “완성됐습니다”라고 말할 때, 개발자는 그게 프로토타입인지 완성품인지 구분할 수 있는가. André Arko의 에세이를 통해 살펴봅니다.
Written by

AI 분신이 나 대신 만남을 주선한다, Pixel Societies의 실험
AI 에이전트가 나 대신 가상 공간을 돌아다니며 연인·친구 후보를 찾아주는 Pixel Societies. 흥미로운 실험이지만, 심리학 연구가 말하는 ‘궁합 예측의 한계’와 맞닥뜨립니다.
Written by

AI 에이전트 스킬, 벤치마크 성능의 절반도 현실에서 안 나온다
AI 에이전트 스킬이 벤치마크와 달리 현실 조건에서 성능 이점이 거의 사라진다는 연구 결과. 34,000개 실제 스킬로 테스트한 UC Santa Barbara·MIT 연구팀의 분석.
Written by

AI 모델은 모를 때 물어보지 않는다, ProactiveBench가 밝힌 구조적 한계
AI 모델이 시각 정보가 부족할 때 도움을 요청하지 않고 그냥 틀린다는 ProactiveBench 연구 소개. 22개 모델 테스트 결과와 강화학습 기반 해결 가능성을 분석합니다.
Written by

Mythos 발표를 보는 세 가지 다른 시각, 모두 맞습니다
Anthropic Mythos 발표를 둘러싼 세 가지 다른 시각을 소개합니다. 지식노동의 신호, 과장된 능력, 제한 출시의 숨은 이유까지.
Written by

에이전트 4개 켜두고 정오가 되면 탈진하는 이유, 병렬 AI 작업의 인지 한계
AI 에이전트를 병렬로 여러 개 실행할 때 발생하는 인지 부하와 생산성 한계를 구글 엔지니어 Addy Osmani의 분석을 통해 살펴봅니다.
Written by

구글 AI Overviews 정확도 논란, 91%와 10% 사이에서 무엇을 봐야 하나
구글 AI Overviews 정확도 연구 분석. 91% 정확도이지만 Google 규모에선 분당 수십만 건 오답 발생. 출처 검증 가능성 하락 문제까지 짚어봅니다.
Written by

AI 성능은 가속 중인데 안전은 제자리, Stanford 2026 AI Index 핵심 정리
Stanford HAI 2026 AI Index Report 핵심 정리. AI 성능 가속, 안전 격차, 투자 역설, jagged frontier 현상까지 데이터로 읽는 AI의 현주소.
Written by

존재하지 않는 병을 AI에게 물었더니, ChatGPT·Gemini의 답변
존재하지 않는 안구 질환 bixonimania를 만들었더니 ChatGPT·Gemini 등 주요 AI가 실제 질환으로 설명했습니다. AI의 지식이 어떻게 형성되는지를 드러낸 실험입니다.
Written by

