TerminalBench
Claude 모델 4개를 엮었더니 하나가 작업을 거부했다
강한 모델이 지휘하고 싼 모델이 실행한다는 통념을 Terminal-Bench로 실측한 실험. Claude 모델 4개를 엮은 오케스트레이터가 정당한 보안 작업을 거부하는 등 네 가지로 역효과를 낸 기록을 정리합니다.
Written by

AI 모델 격차는 사라졌는데.. 승부는 다른 데서 갈렸다
오픈-폐쇄 모델 성능 격차는 좁혀졌는데, 진짜 승부는 하네스와 벤더 이탈 가능성에서 갈리고 있다는 Mozilla 리포트 분석입니다.
Written by

모델은 그대로, 하네스만 바꿨더니 Top 5, LangChain 코딩 에이전트 실험
LangChain이 모델 교체 없이 하네스만 바꿔 코딩 에이전트 성능을 13.7점 올린 방법. 자기 검증 루프, 맥락 주입, 추론 샌드위치 전략을 공개했습니다.
Written by
