AI Sparkup

최신 AI 쉽게 깊게 따라잡기⚡

OpenForgeRL – 실제 하네스에서 에이전트를 end-to-end로 학습하는 오픈소스 RL 프레임워크

OpenForgeRL은 복잡한 에이전트 하네스에서 실행되는 에이전트를 그대로 학습하기 위한 오픈소스 강화학습(RL) 프레임워크다. 논문은 Claude Code, Codex, OpenClaw 같은 하네스가 실제 배포에서는 강력하지만, 기존 SFT/RL 스택이 상태ful multi-process harness inference를 자연스럽게 표현하지 못한다는 문제에서 출발한다.

핵심 구조

OpenForgeRL은 학습과 추론을 분리한다.

구성 요소역할
Lightweight proxy하네스의 모델 호출을 대신 받아 응답하고, 학습 데이터로 기록
RL backendveRL 같은 표준 RL 코드베이스로 기록된 trajectory를 학습
Kubernetes orchestrator각 rollout을 원격 컨테이너에 격리해 대규모 실행
Harness adaptersclaw 기반 코딩 에이전트, GUI 브라우저, computer-use 환경 연결

이 접근은 “모델을 하네스 밖에서 학습한 뒤 끼워 넣기”보다, 배포 때 실제로 쓰는 도구·프롬프트·상태·샌드박스 안에서 행동을 학습한다는 점이 다르다.

평가 결과

논문 초록 기준 OpenForgeRL은 수백~수천 개 태스크만으로 다음 결과를 보고한다.

에이전트벤치마크결과
OpenForgeClawClawEvalpass^3 31.7, pass@3 55.9
OpenForgeClawQwenClawBench33.7
OpenForgeGUIOSWorld-Verified37.7
OpenForgeGUIOnline-Mind2Web63.0
OpenForgeGUIWebVoyager72.3

연구진은 RL이 self-verification, tool coverage, multi-step plan completion을 개선하지만, error recovery는 여전히 약하다고 분석한다.

왜 하네스 네이티브 학습이 필요한가

에이전트 성능은 모델만의 함수가 아니다. 같은 모델도 agent-harness의 도구, 컨텍스트 정책, 파일 시스템, 브라우저, 승인 루프에 따라 전혀 다른 행동을 보인다. 따라서 학습 데이터도 실제 하네스에서 생성되어야 deployment gap이 줄어든다.

OpenForgeRL은 cursor-agent-swarm이나 openclaw처럼 하네스가 점점 복잡해지는 흐름에서, “그 하네스에 맞는 모델 행동을 어떻게 학습할 것인가”라는 질문에 답하려는 시도다.

사용 대상

  • 코딩 에이전트나 GUI 에이전트를 자체 하네스에서 평가·학습하려는 연구팀
  • Kubernetes 기반으로 대량 rollout을 격리 실행할 수 있는 ML 플랫폼 팀
  • open model을 특정 agent harness에 맞춰 강화학습하고 싶은 조직

관련 문서

참고 자료



AI Sparkup 구독하기

최신 게시물 요약과 더 심층적인 정보를 이메일로 받아 보세요! (무료)