arxiv-wiki

HarnessOpt-Bench: Evaluating LLMs at Harness Optimization

← 2026-08-07 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1. Trusted execution for held-out harness optimization. The optimizer can write only the target agent’s harness. It

Figure · 원문 PDF 2쪽 · Figure 1. Trusted execution for held-out harness optimization. The optimizer can write only the target agent’s harness. It

Figure 2. Optimizer models separate more than their coding harnesses. Left: normalized gain for every run in the

Figure · 원문 PDF 4쪽 · Figure 2. Optimizer models separate more than their coding harnesses. Left: normalized gain for every run in the

Figure 3. Gain across model releases. Successive Claude Opus (blue) and GPT (orange) releases on OfficeQA, with all

Figure · 원문 PDF 8쪽 · Figure 3. Gain across model releases. Successive Claude Opus (blue) and GPT (orange) releases on OfficeQA, with all

한 문장 요약

HARNESSOPT-BENCH는 ‘비싼·확률적 평가’ 환경에서 LLM을 이용한 에이전트 harness(프롬프트·도구·제어흐름 등) 최적화를 측정하기 위해, 신뢰 실행 경계·고정된 테스트 홀드아웃·예산 제약을 두고 LLM 최적화기(코딩 하네스와 페어링)를 평가하는 벤치마크를 제안한다.

해결하려는 문제

LLM 기반 에이전트의 성능은 모델 가중치뿐 아니라 이를 둘러싼 harness(프롬프트, 도구, 제어 흐름, 메모리, 오케스트레이션 코드)에 크게 의존한다. 자동화된 harness 최적화(최소 예산 내에서 반복적이고 평가로 유도되는 harness 개선)는 중요하지만, 현재는 평가 프로토콜·시드·예산 등이 연구마다 달라 서로 비교 가능한 표준적 측정이 부족하다. 또한 실제 평가가 비싸고 노이즈가 큰 경우(에이전트 동작을 여러 사례로 실행해야 함)에는 단순한 코드 합성 능력 이상의 진단·추론·선택 능력이 요구된다. 논문은 (RQ1) 현행 최전선 LLM들이 이 과제를 구별할 수 있는지, (RQ2) 어디서 부족한지, (RQ3) 모델 성능과 코딩 하네스 기여도를 분리해 측정할 수 있는지를 묻는다.

핵심 기여

접근 방법

주요 결과

여러 관찰적 결과: (1) 상세 트레이스 열람은 드물고(111셀 중 16회만 요청) 게인과 양의 상관이 아님, (2) 검증에서 관찰된 최고 점수는 실제 제출 후보의 테스트 점수보다 낙관적인 경향(visible validation scores optimistic), (3) 예산 구속은 ‘호출 수’보다 ‘케이스 패스’가 제약 요소로 작용 — 중앙값 옵티마이저는 8회(4%) 호출만 사용하지만 케이스 허용량의 82%를 사용, 55/100 셀은 적어도 하나의 파티션 케이스 예산을 소진함, (4) 연속 모델 릴리스 추적: GPT 시리즈(5개 릴리스)에서 OfficeQA 게인은 단조 증가(+0.03 → +0.49), Claude Opus 계열은 범위 +0.37 → +0.59(비단조적)로 변화.

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트, 표, 그림 설명, 부록 표 포함)에 근거해 작성되었음. 본문에 명시된 표(예: Table 1–4), 수치(예: resolution band, LSS-λ 값), 실행 인프라·프로토콜 설명을 직접 인용·요약했으며, 공개되지 않은 내부 구현 세부사항이나 코드 수준의 미확인 수치는 생성하지 않았음. 그림·부록의 일부 수치는 본문 표와 중복되므로 본문 표를 우선적으로 사용했음.