arxiv-wiki

Boosting LLM Exploration via Weak-Model Guidance in RLVR

← 2026-08-30 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Step-level entropy dynamics of Qwen2.5-

Figure · 원문 PDF 4쪽 · Figure 1: Step-level entropy dynamics of Qwen2.5-

Figure 2: Overview of the proposed prefix-completion RLVR framework. Auxiliary small models first generate

Figure · 원문 PDF 5쪽 · Figure 2: Overview of the proposed prefix-completion RLVR framework. Auxiliary small models first generate

Figure 3: Training dynamics under different prefix probabilities p.

Figure · 원문 PDF 7쪽 · Figure 3: Training dynamics under different prefix probabilities p.

한 문장 요약

약한(소형) 보조 모델이 생성한 부분적 추론(prefix)을 타겟 LLM에 조건으로 주어 완성하도록 RLVR(GRPO) 훈련을 수행함으로써 엔트로피 붕괴를 완화하고 높은 k에서의 pass@k(추론 커버리지)를 개선한다.

해결하려는 문제

기존 RLVR(특히 GRPO)로 LLM의 추론 성능을 높일 수 있으나 훈련 초기 정책 엔트로피가 급감(엔트로피 붕괴)하여 생성 다양성이 좁아지고, 그 결과 pass@k에서 k가 클 때 성능이 떨어지는 문제가 있음. 기존의 알고리즘적 정규화(엔트로피 정규화, 보상 설계 등)는 내부 탐색을 조절하지만, 서로 다른 모델 간의 생성 분포 차이를 이용한 외부(non-parametric) 교란은 간과되어 왔음. 본 연구는 외부(약한) 모델의 부분적 추론 경로로 타겟 모델을 조건화하면 탐색이 확장될지, 그 메커니즘과 실효성을 묻는다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(전체 페이지에서 추출된 텍스트)을 기반으로 작성되었음. 표와 본문에 제시된 주요 수치(예: Table 1, Table 2, Figure 3 관련 값)는 본문에 명시된 값을 그대로 인용함. 다만 Figure 4의 prefix 품질 분포에 표기된 일부 세부 퍼센트 수치는 PDF에서 시각적으로 추출된 부분이 있어 정확한 자리수는 본문 텍스트로 완전히 분해하기 어려워 ‘대다수가 낮은 품질’이라는 정성적 진술로 대신했고, GRPO의 일부 하이퍼파라미터(예: 클리핑 ϵ, β의 값 등)는 본문에 상세 수치로 표기되어 있지 않아 재현 시 추가 정보 확인이 필요함.