AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

Agent Skills 연구 – 스킬이 절차를 고정할 때 효과적이고 검색·맥락에서 실패하는 이유

Agent Skills가 항상 지식을 주입해 성능을 높이는 것은 아니다. 이 연구는 스킬의 주된 가치를 흔들리는 실행 궤적을 안정된 절차로 만드는 “절차적 앵커링(procedural anchoring)”에서 찾고, 검색·맥락·적응이 맞지 않으면 스킬도 실패한다고 분석한다.

연구가 관찰한 핵심

연구진은 서로 다른 벤치마크·하네스·LLM의 통제 실험 기록 8,135건과 질적 분석을 결합했다. Workflow Memory와 맞춘 비교에서 Skills는 6.06점 높았으며, 사례의 65.7%는 절차적 앵커링으로 분류됐다. 반면 명시적 지식 주입으로 설명되는 사례는 4.5%였다.

이는 스킬 문서가 “모델이 몰랐던 사실”을 채우기보다, 작업 순서·검증·도구 사용 규칙을 반복 가능하게 만드는 경우에 특히 유효하다는 뜻이다.

검색은 별도 문제다

후보 스킬 풀이 5개에서 100개로 커질 때 실제 사용 정밀도는 29.6%에서 3.3%로 낮아졌다. 정답 스킬을 정확히 호출하는지와 최종 과제 성공은 반드시 함께 움직이지도 않았다. 비슷한 스킬이 많은 환경에서는 다음을 분리해 평가해야 한다.

평가 대상확인할 질문
발견(discovery)필요한 스킬을 후보에 올렸는가
선택(selection)비슷한 스킬 중 적합한 것을 골랐는가
실행(execution)스킬 절차가 실제 작업을 안정화했는가
결과(outcome)사용자 기준의 산출물이 맞는가

실무 적용

스킬을 만들 때는 장문의 배경 설명보다 실패하기 쉬운 실행 단계를 명확히 적는 편이 낫다. 다만 상황별 전제가 다른 업무를 하나의 규칙으로 고정하면 오히려 실패한다.

  1. 실패 궤적이 반복되는 작업만 스킬 후보로 삼는다.
  2. 트리거 설명에 적용·비적용 조건을 함께 적는다.
  3. 후보 스킬 수가 늘면 태그·도메인·작업 단계로 먼저 좁힌다.
  4. 호출 정확도와 최종 성공률을 별도 지표로 평가한다.

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)