Artificial Analysis Search Index는 에이전트의 검색 성능을 평가할 때 모델과 하네스를 고정하고 검색 API만 바꿔 비교하는 벤치마크다. 검색 제공자를 고를 때 검색 호출 단가만 보지 않고, 답변 품질·총 작업 비용·완료 시간을 함께 판단하려는 팀에 유용하다.
무엇을 측정하나
지수는 DeepSearchQA, BrowseComp, AA-Omniscience 세 평가의 동일 가중 평균이다. 각각 폭넓은 조사형 질문, 여러 단계를 거쳐 찾아야 하는 사실, 모델 내부 지식 밖의 사실 회수를 본다. 출시 시점에는 GPT-5.6 Luna (medium)를 후보 모델로 고정하고, Stirrup 하네스에 web_search, web_fetch, finish 도구와 최대 25턴 제한을 적용했다.
| 비교 상수 | 이유 |
|---|---|
| 같은 모델·프롬프트·채점기 | 모델 능력 차이를 검색 결과 품질로 오인하지 않기 위해 |
| 같은 에이전트 하네스 | 도구 루프와 종료 정책 영향을 통제하기 위해 |
| 제공자별 검색 API만 교체 | 결과 차이를 검색 제공자의 기여로 해석하기 위해 |
| 검색 도구 없는 베이스라인 | 검색이 모델의 내부 지식보다 얼마나 나아지는지 확인하기 위해 |
비용은 검색 API 가격만이 아니다
검색 결과가 정확하고 압축돼 있으면 에이전트가 덜 검색하고 덜 읽어 모델 토큰 비용도 낮아질 수 있다. 반대로 저렴한 검색 호출이 부정확한 결과를 돌려주면 재검색과 긴 추론이 늘어난다. 따라서 제공자 평가는 검색 비용 + 모델 토큰 비용 + 작업 시간으로 하고, 자사 질문·언어·출처 정책으로 재현 평가해야 한다.
한계와 활용법
이 지수는 하나의 고정된 모델과 영어 중심 벤치마크·도구 설정에서 나온 결과다. 한국어 검색, 사내 문서, 최신성 요구, 출처 신뢰도, 지역별 지연은 별도 평가가 필요하다. 그래도 검색 계층만 교체하는 A/B 테스트의 좋은 출발점이 된다.
관련 문서
- searchswarm — 여러 검색 에이전트를 병렬로 조합하는 접근
- agent-harness — 모델과 도구 실행 환경을 함께 평가하는 하네스 설계
참고 자료
- Announcing the Artificial Analysis Search Index: Same Agent, Different Search — Artificial Analysis (2026-08-18)