AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

ThinkingBox – 에이전트가 실제 업무 상태를 끝까지 바꿨는지 검증하는 벤치마크

ThinkingBox는 AI 에이전트가 그럴듯한 답변을 했는지가 아니라, 도구를 써서 요구된 업무 상태를 정확히 완료했는지를 측정하는 오픈소스 평가 프레임워크다. 상태가 있는 MCP 환경에서 실행하고 assertion으로 결과를 검사하므로, 실제 운영 자동화와 가까운 실패를 재현하려는 에이전트 빌더에게 유용하다.

평가 계약

ThinkingBox는 실행 프레임워크와 벤치마크 데이터를 분리한다. 같은 런타임에 조직별 MCP 서버·시나리오를 연결해 자체 평가로 확장할 수 있다.

조건의미
상태형 환경이전 도구 호출의 효과가 다음 단계에 남는다
통제된 도구 표면에이전트가 정해진 MCP 도구만 호출한다
상호작용 사용자필요한 정보를 대화로 얻는 멀티턴 과제를 포함한다
격리·반복 실행초기 상태를 되돌려 모델·프롬프트를 공정하게 비교한다

ThinkingBox-Bench v1.0은 소매·여행·자동차 보험·사내 IT·HR의 가상 조직을 배경으로 507개 업무 과제를 제공한다. 단일 성공률뿐 아니라 20회 반복의 pass@20pass^20을 함께 봐, 한 번 성공한 모델과 일관되게 성공하는 모델을 구분한다.

결과를 읽는 법

공개 분석에서 실패한 실행의 77.5%는 도구 오류·전제조건 실패·조회 실패 뒤의 복구 부재에 해당했다. 따라서 에이전트 품질을 올릴 때는 최종 답변 문장만 다듬기보다, 도구 결과를 해석하고 실패 후 계획을 바꾸며 마지막 상태를 재확인하는 루프를 먼저 점검해야 한다.

# 벤치마크 재현은 공식 릴리스 지침을 따른다.
# 자체 시나리오에서는 assertion으로 필수 상태 변화를 선언한다.
tb agg

언제 쓰면 좋은가

  • MCP 기반 업무 에이전트 팀: 읽기·쓰기 도구가 얽힌 실제 완료 여부를 회귀 테스트할 때
  • 모델 선택 담당자: 평균 점수 외에 재시도 성공률과 일관성을 비교할 때
  • 플랫폼 팀: 프로덕션 도입 전 도구 오류 복구·승인·상태 검증을 테스트할 때

관련 문서

  • ai-agent-evaluation — AI 에이전트 평가의 지표와 벤치마크
  • agent-harness — 도구·검증·복구 루프를 포함한 실행 환경 설계
  • mcp-v2 — MCP 서버의 최신 HTTP 전송 구조

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)