AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Ori Eval – 내 앱 프롬프트와 도구 호출로 모델을 비교하는 OpenRouter 평가 도구

Ori Eval은 OpenRouter가 공개한 AI 애플리케이션용 모델 평가 도구다. 공개 leaderboard에서 “가장 좋은 모델”을 고르는 대신, 내 코드베이스의 프롬프트, 도구 호출, 비용·지연 조건을 기준으로 후보 모델을 비교한다.

핵심 관점

모델 benchmark는 고정된 과제를 측정한다. 하지만 실제 앱에서는 프롬프트 구조, 도구 schema, 데이터, latency budget, 실패 비용이 모두 다르다. Ori Eval은 “최고 모델”이 아니라 “내 앱에서 가장 맞는 모델”을 찾는 문제로 바꾼다.

Ori Eval은 코딩 에이전트가 실행하는 skill 형태로 시작한다. 코드베이스를 탐색해 모델 호출 지점을 찾고, 사용자가 무엇을 중요하게 보는지 묻고, *.eval.ts 파일을 생성한 뒤 여러 후보 모델을 병렬로 실행한다.

무엇을 검사하나

평가 항목예시
도구 호출search는 호출했는가, delete_file은 호출하지 않았는가
완료 여부작업을 끝냈는가
열린 답변 품질LLM judge가 루브릭으로 채점
비용요청당 비용, 월간 볼륨 기준 비용
지연p50, p95 latency
회귀CI에서 eval 실패 시 배포 차단

eval 파일은 TypeScript 코드이며 bun test로 실행된다.

const run = await agent.run("dinner in Lisbon?");
run.tool("search").toBeCalled();
run.tool("delete_file").toNotBeCalled();
run.toComplete();

실행 흐름

curl -fsSL https://openrouter.ai/skills/spawn-ori-eval

OpenRouter 글은 위 명령의 출력 지침을 코딩 에이전트에게 따르게 하는 방식으로 시작하라고 안내한다. OpenRouter MCP server를 쓰는 경우 /spawn-ori-eval로도 시작할 수 있다. 수동 설치 경로는 curl -fsSL https://openrouter.ai/labs/ori/install.sh | bashori login이다. 실행에는 Bun이 필요하다.

어디에 쓰면 좋은가

  • 이미 운영 중인 AI 기능의 모델을 교체하려는 팀
  • model-routing 정책을 비용·품질·지연 기준으로 주기적으로 갱신하려는 팀
  • 고객지원, 코드 리뷰, 검색 에이전트처럼 도구 호출 정확도가 중요한 앱
  • 특정 버그를 regression test로 고정하고 싶은 에이전트 개발팀

기존 평가 도구와의 차이

llm-evaluation-tips-frameworks에서 다루는 RAGAS, DeepEval, Promptfoo가 범용 평가 프레임워크라면 Ori Eval은 OpenRouter 모델 라우팅과 코딩 에이전트 워크플로에 더 붙어 있다. 코드베이스를 탐색해 모델 호출 surface를 찾고, 후보 모델을 OpenRouter의 여러 provider/model 후보로 비교하는 점이 차별점이다.

주의할 점

Ori Eval은 실제 모델 호출을 수행하므로 비용이 든다. OpenRouter FAQ는 일반 eval 비용이 대략 수십 달러 범위가 될 수 있고, 대형 코드베이스일수록 탐색 비용이 커진다고 설명한다. CI에 넣을 때는 별도 opt-in job과 secret 관리가 필요하다. 또한 LLM judge를 쓰는 열린 평가에는 위치 편향, 자기 선호, 장문 선호 같은 judge 편향을 별도로 감시해야 한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)