arxiv-wiki

ClawGym II: Exploring Black-Box RL on Agent Harness

← 2026-08-18 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1. Overview of our black-box RL framework for optimizing general agents through harnesses.

Figure · 원문 PDF 6쪽 · Figure 1. Overview of our black-box RL framework for optimizing general agents through harnesses.

Figure 2. Training dynamics of PPO and GRPO with OpenClaw as the rollout harness.

Figure · 원문 PDF 12쪽 · Figure 2. Training dynamics of PPO and GRPO with OpenClaw as the rollout harness.

Figure 3. Training dynamics of PPO and GRPO with Claude Code as the rollout harness.

Figure · 원문 PDF 12쪽 · Figure 3. Training dynamics of PPO and GRPO with Claude Code as the rollout harness.

한 문장 요약

복잡한 에이전트 실행 하니스(harness)를 불투명(black-box)으로 취급하면서 샌드박스 기반 인프라, 프록시로 캡처한 토큰 기록의 접두사 트리(prefix tree) 재구성, 그리고 토큰 수준 중요도 보정 및 PPO/GRPO 적응을 통해 일반 에이전트를 안정적·대규모로 RL 최적화하는 통합 프레임워크를 제안한다.

해결하려는 문제

현대의 복잡한 에이전트 하니스는 내부 제어 흐름과 도구 실행을 불투명하게 감추어 모델-하니스 상호작용이 단편적이고 포크된(분기된) 모델 호출 기록으로 드러난다. 이로 인해 (1) 장시간 롤아웃을 대규모로 안정적으로 수행할 인프라가 필요하고, (2) 잘게 조각난 모델 호출을 학습 가능한 다중턴 궤적로 재구성해야 하며, (3) 하니스별 상호작용 규약 차이를 통합해 하나의 모델을 다중 하니스로 학습할 수 있는 확장성이 필요하다. 연구 질문은 ‘하니스를 블랙박스로 다루면서 일반 에이전트를 안정적으로 최적화하는 방법’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 논문 PDF 본문(제공된 전체 페이지)을 근거로 분석함. 주요 정량 결과(예: Pass@1 향상치, JobBench·OfficeQA 수치, 학습 스텝 범위, 배치 구성 등)는 본문 표와 도표에서 직접 인용함. 반면 구현의 구체적 하이퍼파라미터(예: 접두사 트리의 잎 수 임계값, 중요도 상한 c̄의 정확한 값, 세부 튜닝 절차)는 본문에서 일반적 설명 또는 일부 실험 구성만 제공되어 구체 수치는 문서에 명시되지 않았으므로 재현 시 추가 튜닝 및 시스템 세부설계가 필요함.