Claude Code 점수가 동료 컴퓨터에서 다르게 나오는 이유
같은 에이전트 eval도 동료 컴퓨터에서는 다른 점수가 나옵니다. 원인은 모델이 아니라 OS, 폴더 이름, 언어 서버 같은 숨은 변수입니다.
Written by
에이전트 위해 CLI를 JSON으로 바꾸면, 비용이 11배 뛴다
에이전트용 CLI를 JSON으로 바꾸면 더 잘 다룰 거라는 조언, Microsoft가 실측하니 비용만 최대 11배 뛰었습니다.
Written by
Claude Code의 모델과 effort, 다른 걸 조절하고 있었다
Claude Code의 모델 설정과 effort 레벨은 서로 다른 걸 조절합니다. 모델은 무엇을 아는지, effort는 얼마나 확인하는지를 정합니다.
Written by
구글 1위인데 ChatGPT는 왜 날 인용 안 할까
AI 검색이 답변에 인용할 사이트를 고르는 수집-읽기-검증-답변 4단계 프로세스와, 구글 1위가 AI 인용을 보장하지 않는 이유를 소개합니다.
Written by
GPT-4는 1년, 요즘 1위 모델은 7주, AI 경쟁이 이렇게 빨라졌다
GPT-4 이후 AI 모델 1위 자리가 7주 만에 뒤집히는 현상과, 중국 모델이 가격 경쟁력으로 점유율을 넓히는 두 가지 트렌드 데이터를 소개합니다.
Written by
해커 없이 DB를 지운 AI 에이전트, 왜 이런 사고가 날까
공격자 없이도 데이터를 삭제하는 AI 에이전트 사고 사례와, 그 위험을 사전에 감지하기 어려운 이유를 다룬 Zenity Labs 연구를 소개합니다.
Written by
모델 만들던 데이터 사이언티스트, 이제 에이전트를 관리한다
데이터 사이언티스트의 일이 모델 구축에서 에이전트 관리·거버넌스로 이동하고 있다는 채용·급여 데이터 기반 트렌드를 소개합니다.
Written by
에이전트 자율성 6단계와 살아남는 커리어의 조건
에이전트 자율성을 6단계로 나눈 Addy Osmani의 프레임과, 정답 없는 일이 남는 시대의 커리어 전략을 소개합니다.
Written by
AI의 속마음을 읽는 J-space, Claude 안에서 스스로 생겨났다
Claude 내부에서 발견된 “J-space”, 말하지 않은 생각과 숨겨진 의도까지 읽어내는 Anthropic의 새 해석가능성 연구를 소개합니다.
Written by
RAG 컨텍스트 68% 쳐내고 정확도는 지킨 kapa.ai의 채점 방식
kapa.ai가 LLM 채점으로 RAG 컨텍스트를 68% 줄이면서도 재현율 96%를 지킨 방법. rerank 한계와 해법을 소개합니다.
Written by









