arxiv-wiki

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction

← 2026-08-08 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Comparison between discriminative and

Figure · 원문 PDF 4쪽 · Figure 1: Comparison between discriminative and

Figure 2: (a) Probability-Based Reward Construction. We use the predicted probability of the

Figure · 원문 PDF 5쪽 · Figure 2: (a) Probability-Based Reward Construction. We use the predicted probability of the

Figure 3: Scaling behavior of RRC.

Figure · 원문 PDF 9쪽 · Figure 3: Scaling behavior of RRC.

한 문장 요약

생성형(Generative) 보상 모델의 비교(순위) 능력을 RL에 활용하기 위해, 응답들 간의 상대적 순위를 바탕으로 스칼라 보상을 구성하는 Ranking-based Reward Construction(RRC)을 제안하여 RL 학습 신호를 개선한다.

해결하려는 문제

기존 RL 파이프라인은 보상 모델에 대해 각 응답에 대한 스칼라 점수를 요구한다. 반면 최근의 생성형 보상 모델은 비교(우선순위·판단) 형태로 학습·추론하도록 설계되어 응답 순위 판단에는 강하지만, 그 확률(선호 토큰 확률)을 그대로 스칼라 보상으로 사용하는 기존 방식은 CoT(Chain-of-Thought) 등의 추론을 사용할 때 확률 붕괴(probability collapse)나 신뢰도(모델 확신)가 보상과 일치하지 않는 문제로 인해 RL 성능으로 잘 전이되지 않는다. 따라서 ‘비교적’ 출력을 내는 생성형 보상 모델의 본질과 RL이 요구하는 ‘스칼라 보상’ 패러다임 사이의 불일치가 핵심 문제이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(주요 본문, 표, 부록 및 캡션 포함)을 근거로 작성되었음. 본문에서 제시된 수치(예: 성능, 학습시간, 확률 분포)와 알고리즘·복잡도 표기는 원문에 따라 인용하였음. 다만 논문 내부에 ‘SCR 쿼리 복잡도’ 표기(본문에서 O(m·log m))와 부록의 정확한 조합(부록에서 NSCR = m(m−1)/2)이 일관되지 않는 표기가 있어, 복잡도 표기는 원문 기술을 그대로 인용했음을 밝힘. 또한 평가에는 자동 평가자(GPT-4o, GPT-5)가 사용되었으므로 평가 편향 가능성은 본문에서 확인되는 제약임.