AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Artificial Analysis Search Index – 같은 에이전트로 비교하는 검색 API 품질·비용·속도

Artificial Analysis Search Index는 에이전트의 검색 성능을 평가할 때 모델과 하네스를 고정하고 검색 API만 바꿔 비교하는 벤치마크다. 검색 제공자를 고를 때 검색 호출 단가만 보지 않고, 답변 품질·총 작업 비용·완료 시간을 함께 판단하려는 팀에 유용하다.

무엇을 측정하나

지수는 DeepSearchQA, BrowseComp, AA-Omniscience 세 평가의 동일 가중 평균이다. 각각 폭넓은 조사형 질문, 여러 단계를 거쳐 찾아야 하는 사실, 모델 내부 지식 밖의 사실 회수를 본다. 출시 시점에는 GPT-5.6 Luna (medium)를 후보 모델로 고정하고, Stirrup 하네스에 web_search, web_fetch, finish 도구와 최대 25턴 제한을 적용했다.

비교 상수이유
같은 모델·프롬프트·채점기모델 능력 차이를 검색 결과 품질로 오인하지 않기 위해
같은 에이전트 하네스도구 루프와 종료 정책 영향을 통제하기 위해
제공자별 검색 API만 교체결과 차이를 검색 제공자의 기여로 해석하기 위해
검색 도구 없는 베이스라인검색이 모델의 내부 지식보다 얼마나 나아지는지 확인하기 위해

비용은 검색 API 가격만이 아니다

검색 결과가 정확하고 압축돼 있으면 에이전트가 덜 검색하고 덜 읽어 모델 토큰 비용도 낮아질 수 있다. 반대로 저렴한 검색 호출이 부정확한 결과를 돌려주면 재검색과 긴 추론이 늘어난다. 따라서 제공자 평가는 검색 비용 + 모델 토큰 비용 + 작업 시간으로 하고, 자사 질문·언어·출처 정책으로 재현 평가해야 한다.

한계와 활용법

이 지수는 하나의 고정된 모델과 영어 중심 벤치마크·도구 설정에서 나온 결과다. 한국어 검색, 사내 문서, 최신성 요구, 출처 신뢰도, 지역별 지연은 별도 평가가 필요하다. 그래도 검색 계층만 교체하는 A/B 테스트의 좋은 출발점이 된다.

관련 문서

  • searchswarm — 여러 검색 에이전트를 병렬로 조합하는 접근
  • agent-harness — 모델과 도구 실행 환경을 함께 평가하는 하네스 설계

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)