AI에이전트
SkillOpt, 마크다운 파일 하나로 GPT-5.5를 23점 끌어올린 방법
Microsoft 연구팀이 AI 에이전트의 스킬 문서를 딥러닝처럼 학습시키는 SkillOpt를 발표했습니다. 마크다운 파일 하나로 GPT-5.5 성능을 평균 23점 향상시킨 방법을 소개합니다.
Written by

AI 코딩 에이전트 자동화 수준, 4가지 기준으로 판단하는 법
AI 코딩 에이전트 자동화, 어디까지 해야 할까요? 작업량·마감·과제유형·비용 4가지 기준으로 나에게 맞는 수준을 판단하는 방법을 소개합니다.
Written by

에이전트 트래픽이 인간을 넘어섰다, Stripe가 인프라 자동화로 응답한 방법
에이전트 트래픽이 처음으로 인간을 추월한 시점에 Stripe가 발표한 Projects 업데이트. 에이전트가 코드 작성을 넘어 인프라 프로비저닝, 과금, 모니터링까지 처리하는 구조를 소개합니다.
Written by

AI 메모리 기능, 모델 정확도를 최대 25배 낮추는 이유
AI 메모리 시스템이 모델의 아첨 행동을 최대 25배 증폭시킨다는 Writer 연구. 메모리 압축 과정의 구조적 편향이 원인이며, 고위험 도메인에서의 AI 신뢰성 문제를 다룹니다.
Written by

AI 에이전트 스킬 파일, 겉으로 멀쩡해도 위험할 수 있습니다
AI 에이전트 스킬 파일에 포함된 외부 링크가 프롬프트 인젝션 경로가 되는 구조적 취약점 분석. GitHub 공식 스킬 사례와 보안 감사 도구 소개.
Written by

루프 엔지니어링이란 무엇인가, Codex·Claude Code가 공유하는 5가지 구조
프롬프트를 직접 입력하던 방식에서 에이전트를 자동으로 구동하는 루프를 설계하는 방식으로. 루프 엔지니어링의 5가지 구성요소를 Codex·Claude Code 비교로 정리합니다.
Written by

AI 멀티에이전트 토큰 소비 분석, 코드 리뷰가 전체의 59% 차지
AI 멀티에이전트 시스템의 단계별 토큰 소비를 실증 분석한 연구. 코드 리뷰가 전체 토큰의 59%를 차지하며, AI 코딩 비용의 핵심은 생성이 아닌 반복 검증에 있음을 밝혔습니다.
Written by

AI 조수가 사라지고 AI 스튜디오가 생겼다, Claude Fable 5 등장
Anthropic의 Mythos 클래스 첫 일반 공개 모델 Claude Fable 5 출시. 수 시간 자율 실행, 멀티 에이전트 운용 등 AI와 협업하는 방식 자체가 달라지는 변화를 소개합니다.
Written by

AI 에이전트가 질문을 못 하는 이유, 배틀십 게임으로 밝혀냈다
MIT·하버드 연구팀이 배틀십 게임을 활용해 AI 에이전트의 질문 능력 한계를 진단하고 개선한 연구. 소형 모델이 1% 비용으로 GPT-5를 앞선 실험 결과와 그 원리를 소개합니다.
Written by

AI 에이전트는 “NO”를 모른다, Context as Code로 아키텍처 지키는 법
AI 코딩 에이전트가 아키텍처 경계를 무시하는 문제와, 빌드타임에 “NO”를 자동화하는 Context Compilation Pattern을 소개합니다.
Written by
