arxiv-wiki

Verify Smarter, Evolve Further: Efficient Harness Evolution through Behavior-Aware Verification

← 2026-08-29 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Comparison of verification paradigms:

Figure · 원문 PDF 1쪽 · Figure 1: Comparison of verification paradigms:

Figure 2: Overview of HARNESSLENS. Context Exploration characterizes available tasks and identifies user-

Figure · 원문 PDF 3쪽 · Figure 2: Overview of HARNESSLENS. Context Exploration characterizes available tasks and identifies user-

Figure 3: Illustrative contrast between task-space struc-

Figure · 원문 PDF 8쪽 · Figure 3: Illustrative contrast between task-space struc-

한 문장 요약

행동 인식 검증을 통해 제한된 상호작용 예산 하에서 에이전트 하네스(harness)를 비용 효율적으로 자동 진화시키는 HARNESSLENS 프레임워크를 제안한다.

해결하려는 문제

하네스(지시문, 툴 설명, 스킬, 런타임 컴포넌트 등)는 LLM 에이전트의 동작을 결정하지만 하네스를 적응·개선하려면 검증을 위한 다수의 롤아웃이 필요하다. 기존 제안-검증 방식은 모든 후보를 고정된(또는 무작위) 행위 검증 집합에 대해 평가하여 후보와 무관한 태스크에 예산을 낭비하고, 전체 집계 지표가 특정 행위 회귀를 가릴 수 있다는 한계가 있다. 핵심 질문은 상호작용 증거에서 자동으로 하네스를 연속적으로 진화시킬 때 제한된 예산 안에서 어떻게 신뢰성 있고 샘플 효율적으로 검증할 것인가이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(및 부록 포함)에 근거하여 작성되었다. 본문과 부속 섹션에서 명시된 수치(표 1, 표 2, 예산 최대치 등)와 절차를 직접 인용·요약했다. 소스 문서에서 직접 확인하기 어려운 산업적 비용(토큰·금전적 비용)이나 구현 외부 요인은 재구성하지 않았다. 추가 구현·실험 세부(코드·런타임 로그·정밀 예산 항목)는 저자가 공개한 보조자료와 저장소를 통해 확인할 것을 권장한다.