구글의 사내용 포맷 OKF, 내 웹사이트에도 통했다
구글이 사내용으로 만든 Open Knowledge Format을 개인 웹사이트에 적용해본 실험기. AI 에이전트가 읽는 웹사이트의 미래 방향을 제시합니다.
Written by
토큰 단가 33% 싼 Sonnet 5, 실제 청구서는 3.7배 더 나왔다
마이크로소프트가 Claude Sonnet 4.6과 5를 150회 비교 실험. 토큰 단가는 싸도 실제 비용과 품질은 작업 종류에 따라 정반대로 갈렸습니다.
Written by
좋은 모델로도 안 되는 에이전트, LangChain이 말하는 4개의 루프
LangChain이 제시한 에이전트 하네스 4단계 루프 구조. 반복 실행부터 검증, 이벤트 트리거, 자기개선까지 안정적 에이전트 설계 원칙을 소개합니다.
Written by
1M 토큰에 4.40달러, 오픈모델이 오퍼스 자리를 넘본다
오픈웨이트 모델 GLM 5.2를 직접 써본 후기와 함께, 왜 이 모델이 프론티어 AI 랩의 추론 마진을 위협하는지 분석합니다.
Written by
Fable 5는 담합은 저지르면서 보험사기는 거부했다
Andon Labs의 Vending-Bench 테스트에서 드러난 Claude Fable 5의 담합·기만 행동과, 보험사기는 거부하면서도 담합은 저지르는 이상한 윤리 경계선을 다룹니다.
Written by
검색을 많이 시킬수록 정답률이 떨어지는 AI 에이전트의 역설
검색을 더 시켜도 정답률이 떨어지는 AI 검색 에이전트의 역설. DiscoBench 연구가 밝힌 진짜 약점은 검색력이 아니라 되묻는 능력입니다.
Written by
Opus 4.8, 구형 모델보다 도구 호출에서 더 헤맨다
최신 Claude 모델이 오히려 커스텀 도구 호출에 더 서툴러진 이유를 개발자 아르민 로나허의 실제 추적 사례로 살펴봅니다.
Written by
마이크로소프트 코파일럿 유료전환 4.5%가 부른 8월 대개편
마이크로소프트 코파일럿의 낮은 유료전환율과 그로 인한 8월 통합 앱·AutoPilot 개편의 실제 배경을 데이터로 분석합니다.
Written by
텍스트를 이미지로 바꿔 Claude 토큰비용을 아끼는 pxpipe의 함정
PNG로 바꿔 Claude 토큰 비용을 최대 70% 줄이는 오픈소스 도구 pxpipe와, 그 이면의 정확성 문제를 함께 다룹니다.
Written by









