ThinkingBox는 AI 에이전트가 그럴듯한 답변을 했는지가 아니라, 도구를 써서 요구된 업무 상태를 정확히 완료했는지를 측정하는 오픈소스 평가 프레임워크다. 상태가 있는 MCP 환경에서 실행하고 assertion으로 결과를 검사하므로, 실제 운영 자동화와 가까운 실패를 재현하려는 에이전트 빌더에게 유용하다.
평가 계약
ThinkingBox는 실행 프레임워크와 벤치마크 데이터를 분리한다. 같은 런타임에 조직별 MCP 서버·시나리오를 연결해 자체 평가로 확장할 수 있다.
| 조건 | 의미 |
|---|---|
| 상태형 환경 | 이전 도구 호출의 효과가 다음 단계에 남는다 |
| 통제된 도구 표면 | 에이전트가 정해진 MCP 도구만 호출한다 |
| 상호작용 사용자 | 필요한 정보를 대화로 얻는 멀티턴 과제를 포함한다 |
| 격리·반복 실행 | 초기 상태를 되돌려 모델·프롬프트를 공정하게 비교한다 |
ThinkingBox-Bench v1.0은 소매·여행·자동차 보험·사내 IT·HR의 가상 조직을 배경으로 507개 업무 과제를 제공한다. 단일 성공률뿐 아니라 20회 반복의 pass@20과 pass^20을 함께 봐, 한 번 성공한 모델과 일관되게 성공하는 모델을 구분한다.
결과를 읽는 법
공개 분석에서 실패한 실행의 77.5%는 도구 오류·전제조건 실패·조회 실패 뒤의 복구 부재에 해당했다. 따라서 에이전트 품질을 올릴 때는 최종 답변 문장만 다듬기보다, 도구 결과를 해석하고 실패 후 계획을 바꾸며 마지막 상태를 재확인하는 루프를 먼저 점검해야 한다.
# 벤치마크 재현은 공식 릴리스 지침을 따른다.
# 자체 시나리오에서는 assertion으로 필수 상태 변화를 선언한다.
tb agg언제 쓰면 좋은가
- MCP 기반 업무 에이전트 팀: 읽기·쓰기 도구가 얽힌 실제 완료 여부를 회귀 테스트할 때
- 모델 선택 담당자: 평균 점수 외에 재시도 성공률과 일관성을 비교할 때
- 플랫폼 팀: 프로덕션 도입 전 도구 오류 복구·승인·상태 검증을 테스트할 때
관련 문서
- ai-agent-evaluation — AI 에이전트 평가의 지표와 벤치마크
- agent-harness — 도구·검증·복구 루프를 포함한 실행 환경 설계
- mcp-v2 — MCP 서버의 최신 HTTP 전송 구조
참고 자료
- How we built ThinkingBox to measure whether agents finish the job — Microsoft Command Line (2026-08-19)
- microsoft/thinkingbox — GitHub 공식 저장소
- microsoft/thinkingbox-data — 벤치마크 데이터·MCP 서버