arxiv-wiki

Prime Agent: A Self-Improving RLM Harness

← 2026-08-25 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Prime Agent connects persistent root and subagent sessions to a daemon, Continual

Figure · 원문 PDF 3쪽 · Figure 1: Prime Agent connects persistent root and subagent sessions to a daemon, Continual

Figure 2: Prime Agent state hierarchy. The boundary between L1 and L2 separates token-visible

Figure · 원문 PDF 4쪽 · Figure 2: Prime Agent state hierarchy. The boundary between L1 and L2 separates token-visible

Figure 3: Multi-agent orchestration lifecycle and direct agent-to-agent communication.

Figure · 원문 PDF 5쪽 · Figure 3: Multi-agent orchestration lifecycle and direct agent-to-agent communication.

한 문장 요약

Prime Agent는 영구 IPython REPL, Recursive Language Model(rlm) 호출, 디스크-백업된 Continual Harness(프롬프트 노트·메모리·스킬·서브에이전트 사양), 데몬 기반 세션 관리 및 직접 에이전트간 통신을 결합해 장기(horizon) 작업에서 모델이 테스트-시간 계산·정보 관리를 스스로 구성·개선하도록 하는 오픈소스 에이전트 하네스이다.

해결하려는 문제

최신 대형 언어모델은 가중치와 활성 토큰 컨텍스트(L0/L1)만으로는 장기 대리(agency) 과제를 해결하기에 부족하고, 하네스가 상태의 손실·자원 오산정·비표현적 인터페이스 등으로 모델 실패를 유발하면 측정이 모델의 진짜 능력 대신 하네스 한계에 묶인다. 본 논문은 (1) 모델이 테스트-시간에 추가 토큰·API 비용을 실제 성과로 전환할 수 있는지, (2) 영구 REPL과 영속 상태를 통해 장기 컨텍스트 정보를 검색·변형·집계할 수 있는지, (3) 재귀적·영구적 실행이 다일(多日) 실험·시스템 구축·재귀 제어·온라인 정제(refinement)를 지속할 수 있는지 등을 해결하고자 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–16)에서 직접 추출한 내용에 근거한다. 표와 그림의 일부 항목(특히 Table 1과 Figure 7/8의 세부 열 배치 및 일부 비용·퍼포먼스 포인트)은 본문과 그림 레이블을 기반해 해석했으며, 그림의 축·범례 해석이나 표의 열 매핑이 명확하지 않아 수치 해석에 불확실성이 존재할 수 있다. 본문에 명시된 정량값(예: ARC-AGI-3 95.5%, nanoGPT 85.5시간·19 레코드, Factorio 23.4M 토큰·24/196 기술·71%)은 PDF에 직접 보고된 값이다.