Orchard는 Microsoft Research가 공개한 오픈소스 에이전틱 AI 연구 프레임워크다. 핵심은 Orchard Env라는 Kubernetes 기반 환경 서비스를 두고, 코딩·웹 탐색·개인비서 에이전트를 같은 인프라에서 훈련, rollout, 평가하게 만드는 것이다.
문제의식
에이전트 연구의 병목은 모델만이 아니다. 실제 성능은 샌드박스, 파일시스템, 브라우저, 툴 호출, 상태 관리, 평가 파이프라인을 포함한 agent-harness에 크게 좌우된다. 하지만 많은 연구는 단순화된 루프에서 모델을 훈련하고, 배포 때는 Codex, OpenClaw, ZeroClaw 같은 실제 하네스에 넣는다. 이 간극 때문에 훈련 환경과 배포 환경이 달라진다.
Orchard는 환경 계층을 독립 서비스로 분리한다. 각 rollout은 격리된 컨테이너에서 실행되고, lightweight proxy가 하네스의 모델 호출을 기록해 훈련 데이터로 만든다. 따라서 연구자는 새 benchmark나 agent system을 추가하더라도 샌드박스와 데이터 수집 인프라를 매번 다시 만들 필요가 없다.
구조
| 구성 | 역할 |
|---|---|
| Orchard Env | Kubernetes 기반 격리 환경 서비스 |
| REST API | 샌드박스 생성, 명령 실행, 파일 접근, 네트워크 제어 |
| Harness integration | Codex, OpenClaw, ZeroClaw 등 실제 하네스 안의 rollout 기록 |
| Training recipes | SWE, GUI, Claw 도메인별 데이터·학습·평가 절차 |
| Evaluation workflows | 강화학습 rollout과 최종 평가를 같은 환경에서 실행 |
세 가지 레시피
Orchard-SWE
소프트웨어 엔지니어링 에이전트 훈련 레시피다. Mini-SWE-Agent를 기반으로 GitHub issue 해결 작업을 다루고 SWE-bench Verified로 평가한다. Microsoft 발표에 따르면 3B대 활성 파라미터 모델로 SWE-bench Verified 69.7%, value-model reranking 사용 시 73.0%에 도달했다.
중요한 점은 실패 trajectory를 버리지 않는다는 것이다. credit-assignment supervised fine-tuning으로 실패 시도 중 유용했던 부분을 학습하고, 이후 Balanced Adaptive Rollout과 dense reward 기법으로 sparse feedback 문제를 완화한다.
Orchard-GUI
브라우저 조작 에이전트 레시피다. 4B vision-language model을 400개 distilled demonstration과 2,200개 open-ended task로 훈련해 WebVoyager, Online-Mind2Web, DeepShop 같은 웹 과제에서 평균 68.4% 성공률을 보였다고 발표했다.
Orchard-Claw
메일, 캘린더, 검색, 툴 조합 같은 개인비서 과제를 다룬다. 200개 synthetic task만으로 Claw-Eval에서 59.6%를 기록했고, ZeroClaw와 결합하면 73.9%까지 올라간다고 설명한다. Codex 하네스 안에서는 훈련 전 18.6%에서 훈련 후 51.5%로 개선됐다는 점이 하네스 내 훈련의 의미를 보여준다.
왜 중요한가
Orchard의 메시지는 “작은 오픈 모델도 환경과 훈련 절차가 맞으면 복잡한 에이전트 과제에서 경쟁력 있다”는 것이다. 특히 에이전트 학습에서는 단일 정답 데이터보다 실행 trajectory, 실패 로그, 테스트 결과, 도구 호출 기록이 중요하다. Orchard는 이 경험 데이터를 재사용 가능한 자산으로 취급하고, value model이나 다음 세대 agent training으로 이어 붙이는 방향을 제시한다.
어디에 쓰면 좋은가
- 코딩 에이전트를 자체 benchmark와 실제 하네스에서 훈련하려는 연구팀
- 웹 탐색 또는 개인비서 에이전트 평가 환경을 재사용 가능한 인프라로 만들려는 팀
- 오픈 모델을 사내 하네스에서 강화학습하고 싶은 플랫폼 조직
- SWE-bench류 점수보다 agent rollout 품질과 실패 원인을 함께 분석하려는 팀
주의할 점
Orchard는 연구 프레임워크에 가깝다. Kubernetes, sandbox orchestration, 데이터 수집, 평가 파이프라인 운영 부담이 있다. 단순 앱 개발자는 cloudflare-computer나 상용 에이전트 런타임이 더 빠를 수 있다. 반대로 “모델을 실제 하네스에서 훈련한다”는 요구가 있다면 Orchard가 중요한 레퍼런스다.
관련 문서
- agent-harness — AI 에이전트 성능을 결정하는 실행 하네스 설계
- microsoft-agent-framework-harness — Python·.NET용 배터리 포함 에이전트 실행 하네스
- openforgerl — 실제 하네스 안에서 코딩·GUI 에이전트를 강화학습하는 프레임워크
- evocode-bench — 코딩 에이전트의 누적 작업 유지 능력을 재는 벤치마크
- browser-use — AI 에이전트가 웹사이트를 조작하게 하는 브라우저 자동화 프레임워크
참고 자료
- Orchard: An open framework for scalable agentic AI — Microsoft Research Blog (2026-08-03)
- microsoft/Orchard — GitHub 공식 저장소
- microsoft/Orchard datasets — Hugging Face