AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Skill-Use – AI 에이전트가 스킬을 실제로 찾아 실행하는지 측정하는 벤치마크

Skill-Use는 스킬 파일이 잘 작성됐는지나 최종 과제 성공률만 보는 대신, AI 에이전트가 필요한 스킬을 알아보고 전체 지침을 읽은 뒤 실제 절차와 제한을 지키는지를 측정하는 벤치마크다. 스킬 카탈로그가 커지는 환경에서는 “스킬이 있다”는 사실만으로 에이전트가 그 능력을 활용한다고 볼 수 없다는 문제에서 출발한다.

세 가지 측정 축

확인하는 질문
Trigger이름과 짧은 설명만 보고 관련 스킬을 발동하는가
Compliance전체 절차를 읽은 뒤 요구된 순서와 방법을 지키는가
Boundary금지된 도구·파일·행동을 피하는가

SU 점수는 Trigger가 일어난 뒤에만 실행을 인정한다. 즉 우연히 결과를 맞혔더라도 스킬을 무시했다면 신뢰할 수 있는 스킬 사용으로 보지 않는다.

결과가 말하는 것

연구진은 실제 스킬 79개, 실행 가능한 태스크 177개, 9개 도메인을 Docker 격리 환경에서 평가했다. 8개 LLM과 두 하네스를 비교한 최고 구성의 SU 점수는 0.613에 그쳤다. 발동 실패와 절차 준수 실패는 각각 독립적인 병목이었고, 모델 순위조차 하네스에 따라 달라졌다.

따라서 스킬 사용은 모델의 고정 능력보다 description 품질, 스킬 탐색 UX, 도구 노출, 컨텍스트 로딩 규칙을 포함한 agent-harness의 특성으로 다뤄야 한다. 운영 팀은 최종 산출물 평가 외에 “올바른 스킬을 로드했는가”와 “금지 경계를 지켰는가”를 trace 기반 평가에 넣는 편이 좋다.

관련 문서

  • agent-skills — 스킬의 구조와 작성 원칙
  • assay-agent-skills — 스킬의 실제 기여도를 태스크별로 측정하는 프레임워크
  • agent-harness — 모델 외부 실행 환경이 성능을 좌우하는 이유

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)