Agent Lightning은 편집 가능한 AI 에이전트와 벤치마크를 입력으로 받아, 프롬프트·도구·워크플로·모델·추론 설정을 측정 결과에 따라 개선하도록 돕는 Microsoft의 에이전트 최적화 스킬이다. 새 에이전트를 처음부터 학습시키기보다 현재의 Claude Code, Codex, GitHub Copilot 기반 작업 흐름을 유지한 채 개선 실험을 반복하려는 팀에 맞는다.
무엇을 최적화하는가
| 대상 | 가능한 변경 | 반드시 함께 볼 지표 |
|---|---|---|
| 프롬프트 | 역할, 절차, 출력 제약 | 성공률·형식 준수 |
| 도구 | 설명, 선택 규칙, 인수 형식 | 도구 호출 오류·재시도 |
| 워크플로 | 계획·실행·검증 순서 | 완료율·회귀 실패 |
| 모델 설정 | 모델, reasoning 수준, 예산 | 비용·지연 시간·품질 |
핵심은 한 번의 데모가 아니라 고정 벤치마크에서 개선 전후를 비교하는 것이다. 점수만 올리고 비용이나 지연 시간이 급증하면 운영상의 개선이라고 보기 어렵다.
안전한 적용 순서
- 실제 업무에서 익명화한 실패 사례와 자동 채점 기준을 분리한다.
- 기준 에이전트를 고정해 성공률·비용·지연 시간을 기록한다.
- 한 번에 하나의 레버만 바꾸고, 같은 벤치마크와 holdout 사례를 다시 실행한다.
- 통과한 변경은 diff와 근거를 검토한 뒤 채택하고, 실패한 변경도 재현 가능하게 남긴다.
이는 agent-harness의 “모델 바깥 실행계”를 개선하는 실천 도구다. 학습용 rollout까지 직접 운영해야 한다면 agent-rl-training-frameworks의 프레임워크를 함께 검토한다.
설치
gh skill install microsoft/agent-lightning agent-lightning --agent <agent>권한이 넓은 에이전트의 프롬프트·도구를 자동 수정할 수 있으므로, 프로덕션 저장소에 바로 적용하지 말고 격리된 benchmark 브랜치와 사람 검토를 먼저 둔다.
관련 문서
- agent-harness — 프롬프트·도구·피드백 루프로 이뤄진 실행계
- agent-rl-training-frameworks — 에이전트 강화학습 도구 선택 기준
- ai-agent-evaluation-tips-roadmap — 평가 체계를 설계하는 방법
참고 자료
- Agent Lightning v1.0.1 — GitHub 공식 릴리스