Ori Eval은 OpenRouter가 공개한 AI 애플리케이션용 모델 평가 도구다. 공개 leaderboard에서 “가장 좋은 모델”을 고르는 대신, 내 코드베이스의 프롬프트, 도구 호출, 비용·지연 조건을 기준으로 후보 모델을 비교한다.
핵심 관점
모델 benchmark는 고정된 과제를 측정한다. 하지만 실제 앱에서는 프롬프트 구조, 도구 schema, 데이터, latency budget, 실패 비용이 모두 다르다. Ori Eval은 “최고 모델”이 아니라 “내 앱에서 가장 맞는 모델”을 찾는 문제로 바꾼다.
Ori Eval은 코딩 에이전트가 실행하는 skill 형태로 시작한다. 코드베이스를 탐색해 모델 호출 지점을 찾고, 사용자가 무엇을 중요하게 보는지 묻고, *.eval.ts 파일을 생성한 뒤 여러 후보 모델을 병렬로 실행한다.
무엇을 검사하나
| 평가 항목 | 예시 |
|---|---|
| 도구 호출 | search는 호출했는가, delete_file은 호출하지 않았는가 |
| 완료 여부 | 작업을 끝냈는가 |
| 열린 답변 품질 | LLM judge가 루브릭으로 채점 |
| 비용 | 요청당 비용, 월간 볼륨 기준 비용 |
| 지연 | p50, p95 latency |
| 회귀 | CI에서 eval 실패 시 배포 차단 |
eval 파일은 TypeScript 코드이며 bun test로 실행된다.
const run = await agent.run("dinner in Lisbon?");
run.tool("search").toBeCalled();
run.tool("delete_file").toNotBeCalled();
run.toComplete();실행 흐름
curl -fsSL https://openrouter.ai/skills/spawn-ori-evalOpenRouter 글은 위 명령의 출력 지침을 코딩 에이전트에게 따르게 하는 방식으로 시작하라고 안내한다. OpenRouter MCP server를 쓰는 경우 /spawn-ori-eval로도 시작할 수 있다. 수동 설치 경로는 curl -fsSL https://openrouter.ai/labs/ori/install.sh | bash 뒤 ori login이다. 실행에는 Bun이 필요하다.
어디에 쓰면 좋은가
- 이미 운영 중인 AI 기능의 모델을 교체하려는 팀
- model-routing 정책을 비용·품질·지연 기준으로 주기적으로 갱신하려는 팀
- 고객지원, 코드 리뷰, 검색 에이전트처럼 도구 호출 정확도가 중요한 앱
- 특정 버그를 regression test로 고정하고 싶은 에이전트 개발팀
기존 평가 도구와의 차이
llm-evaluation-tips-frameworks에서 다루는 RAGAS, DeepEval, Promptfoo가 범용 평가 프레임워크라면 Ori Eval은 OpenRouter 모델 라우팅과 코딩 에이전트 워크플로에 더 붙어 있다. 코드베이스를 탐색해 모델 호출 surface를 찾고, 후보 모델을 OpenRouter의 여러 provider/model 후보로 비교하는 점이 차별점이다.
주의할 점
Ori Eval은 실제 모델 호출을 수행하므로 비용이 든다. OpenRouter FAQ는 일반 eval 비용이 대략 수십 달러 범위가 될 수 있고, 대형 코드베이스일수록 탐색 비용이 커진다고 설명한다. CI에 넣을 때는 별도 opt-in job과 secret 관리가 필요하다. 또한 LLM judge를 쓰는 열린 평가에는 위치 편향, 자기 선호, 장문 선호 같은 judge 편향을 별도로 감시해야 한다.
관련 문서
- openrouter-tutorial-langchain-chatopenrouter — LangChain에서 OpenRouter 모델 라우팅 사용하기
- openrouter-mcp-server — OpenRouter 모델 카탈로그와 벤치마크를 MCP로 조회하기
- model-routing — 여러 모델을 비용·품질·지연 기준으로 선택하는 운영 계층
- llm-evaluation-tips-frameworks — 애플리케이션 평가 프레임워크 선택 기준
- g-eval — LLM Judge를 루브릭과 확률 점수로 안정화하는 평가 프레임워크
참고 자료
- Ori Eval: Find the Best Model for What You’re Building — OpenRouter Blog (2026-08-03)
- Ori Eval docs — OpenRouter Docs