OpenForgeRL은 복잡한 에이전트 하네스에서 실행되는 에이전트를 그대로 학습하기 위한 오픈소스 강화학습(RL) 프레임워크다. 논문은 Claude Code, Codex, OpenClaw 같은 하네스가 실제 배포에서는 강력하지만, 기존 SFT/RL 스택이 상태ful multi-process harness inference를 자연스럽게 표현하지 못한다는 문제에서 출발한다.
핵심 구조
OpenForgeRL은 학습과 추론을 분리한다.
| 구성 요소 | 역할 |
|---|---|
| Lightweight proxy | 하네스의 모델 호출을 대신 받아 응답하고, 학습 데이터로 기록 |
| RL backend | veRL 같은 표준 RL 코드베이스로 기록된 trajectory를 학습 |
| Kubernetes orchestrator | 각 rollout을 원격 컨테이너에 격리해 대규모 실행 |
| Harness adapters | claw 기반 코딩 에이전트, GUI 브라우저, computer-use 환경 연결 |
이 접근은 “모델을 하네스 밖에서 학습한 뒤 끼워 넣기”보다, 배포 때 실제로 쓰는 도구·프롬프트·상태·샌드박스 안에서 행동을 학습한다는 점이 다르다.
평가 결과
논문 초록 기준 OpenForgeRL은 수백~수천 개 태스크만으로 다음 결과를 보고한다.
| 에이전트 | 벤치마크 | 결과 |
|---|---|---|
| OpenForgeClaw | ClawEval | pass^3 31.7, pass@3 55.9 |
| OpenForgeClaw | QwenClawBench | 33.7 |
| OpenForgeGUI | OSWorld-Verified | 37.7 |
| OpenForgeGUI | Online-Mind2Web | 63.0 |
| OpenForgeGUI | WebVoyager | 72.3 |
연구진은 RL이 self-verification, tool coverage, multi-step plan completion을 개선하지만, error recovery는 여전히 약하다고 분석한다.
왜 하네스 네이티브 학습이 필요한가
에이전트 성능은 모델만의 함수가 아니다. 같은 모델도 agent-harness의 도구, 컨텍스트 정책, 파일 시스템, 브라우저, 승인 루프에 따라 전혀 다른 행동을 보인다. 따라서 학습 데이터도 실제 하네스에서 생성되어야 deployment gap이 줄어든다.
OpenForgeRL은 cursor-agent-swarm이나 openclaw처럼 하네스가 점점 복잡해지는 흐름에서, “그 하네스에 맞는 모델 행동을 어떻게 학습할 것인가”라는 질문에 답하려는 시도다.
사용 대상
- 코딩 에이전트나 GUI 에이전트를 자체 하네스에서 평가·학습하려는 연구팀
- Kubernetes 기반으로 대량 rollout을 격리 실행할 수 있는 ML 플랫폼 팀
- open model을 특정 agent harness에 맞춰 강화학습하고 싶은 조직
관련 문서
- agent-harness — AI 에이전트 성능을 결정하는 하네스 설계
- openclaw — 오픈소스 코딩 에이전트 하네스
- agent-rl-training-frameworks — 에이전트 강화학습 프레임워크
- ai-agent-evaluation — 에이전트 평가 하네스 설계
참고 자료
- OpenForgeRL: Train Harness-native Agents in Any Environment — arXiv (2026-07-23)