arxiv-wiki

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

← 2026-08-29 목록으로 돌아가기

한 문장 요약

사전학습 LLM의 추론 능력을 검증자 보상으로 향상시키기 위한 메모리 효율적 후처리로서 Evolution Strategies(ES)의 최적화 역학을 이론·실험적으로 분석하여, ES가 GRPO보다 더 넓은 추론 커버리지를 제공하고 실무적 설정(정규화·표본·추정기 등)에 대한 권장값을 제시한다.

해결하려는 문제

기존의 RL형 후처리 기법인 Group Relative Policy Optimization(GRPO)은 Pass@1(단일 샘플 정확도)을 향상시키지만 학습 도중 엔트로피 붕괴를 일으켜 반복 샘플링 시의 대규모 K에서의 Pass@K를 저하시킬 수 있다. 반면 ES는 메모리·병렬성 측면 장점이 보고되었으나 그 최적화 거동(추론 커버리지, 파라미터 이동과 능력 보존의 관계, 하이퍼파라미터·추정기 설계)이 충분히 이해되지 않아 GRPO 대비 어떤 장점을 갖는지 범위를 규정하기 어렵다. 본 논문은 위 문제들을 체계적으로 규명하고 ES의 장단점과 적용 조건을 밝히는 것을 목표로 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문 전체(본문, 표, 부록)의 텍스트를 근거로 작성되었음. 본문에 명시된 수치(예: ‘Full ES는 GRPO보다 40.7–44.1× 더 멀리 이동’, ‘τ=1.5×10^−3에서 (0,τ]에 77.6–93.0% 포함’, magnitude-thresholded Pass@1 변화 등)는 원문 표·본문·부록에서 직접 발췌함. 논문 외부 코드·저장소의 상세 구현(예: GitHub 최신 커밋)이나 저자가 외부에서 공개하지 않은 추가 실험은 확인하지 못했으므로, 집계된 다중-작업 평균이나 파레토 프런트의 정량적 비교 등 논문이 직접 제공하지 않은 추가 수치 재계산은 수행하지 않았음을 밝힌다.