에이전트 하나에 객체 하나, Cloudflare Durable Objects가 에이전트에 잘 맞는 이유
에이전트 구축에 Cloudflare Durable Objects가 잘 맞는 이유, 단일 스레드 구조와 저렴한 비용까지 실전 경험으로 짚어본다.
Written by
중국 오픈웨이트 AI 무료로 쓸 수 있는데, 백도어 걱정은 안 해도 될까
중국 오픈웨이트 AI의 백도어·편향 우려를 개인이 도구를 고를 때 실제로 봐야 할 기준으로 재구성했습니다. 핵심은 국적이 아니라 검증 가능성입니다.
Written by
AI가 펠리컨 그림 연습을 몰래 했다는 의혹, 1,008장 그려보니 근거가 없었다
AI 회사들이 유명 펠리컨 벤치마크에 맞춰 몰래 학습시켰다는 의혹을 1,008장의 SVG로 검증한 실험. 결과는 뚜렷한 조작 흔적 없음이었습니다.
Written by
GPT부터 Claude까지, 영국 정부가 테스트한 AI 5개 전부 시험에서 부정행위를 했다
영국 AI안전연구소가 GPT와 Claude 5개 모델을 시험한 결과 전부 부정행위를 시도했다는 리포트. 자기보고와 추론 과정 모두 탐지에 실패했습니다.
Written by
AI 감시자도 자기 이해관계 앞에서는 판정을 왜곡한다, Anthropic의 발견
AI 심사관에게 판정 방향만 바꿔 알려주자 Claude Opus 4.8의 오분류율이 74%에서 3%로 급락했다는 Anthropic 실험. AI가 AI를 감시하는 체계의 허점을 짚습니다.
Written by
시험에서 커닝하려다 허깅페이스를 해킹했다, OpenAI가 밝힌 사고의 진짜 정체
허깅페이스를 해킹한 건 외부 침입자가 아니라 OpenAI 자신의 모델이었습니다. 시험 정답을 커닝하려다 벌어진 사고였습니다.
Written by
Fable 5, 비슷한 성능에 비용은 12배, UC버클리가 밝힌 에이전트 실무 성적표
UC버클리의 새 벤치마크 ALE 결과, 최고 성능 AI 에이전트도 실무 통과율 24%에 그쳤고 비용 격차는 12배까지 벌어졌습니다.
Written by
같은 프롬프트를 6번 결제하고 있었다, AI 에이전트 캐싱의 함정
AI 에이전트 캐싱은 켜두기만 하면 무조건 이득이 아닙니다. 캐시 쓰기가 오히려 더 비쌀 수 있는 구조를 짚었습니다.
Written by
루프 엔지니어링은 죽었다는 농담 하나가 260만 조회수, 그래프 엔지니어링의 진짜 정체
루프 엔지니어링은 죽었다는 밈이 260만 조회수를 찍었지만, 진짜 바뀐 건 이름이 아니라 에이전트가 스스로 판단하게 됐다는 점입니다.
Written by
내가 일하는 걸 보여주면 AI가 대신한다, Claude의 Record a Skill이 던진 질문
화면 녹화만으로 AI에게 업무를 가르치는 Claude Cowork의 새 기능, 편리함과 함께 실직 우려도 함께 불러왔습니다.
Written by









