arxiv-wiki

Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

← 2026-08-20 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Teacher–verifier disagreement in two evidence-aggregation tasks: Multi-Table Extraction

Figure · 원문 PDF 2쪽 · Figure 1: Teacher–verifier disagreement in two evidence-aggregation tasks: Multi-Table Extraction

Figure 2: Overview of GC-OPD. GC-OPD computes group-normalized verifier rewards and trajectory-

Figure · 원문 PDF 3쪽 · Figure 2: Overview of GC-OPD. GC-OPD computes group-normalized verifier rewards and trajectory-

Figure 3: Held-out validation used to select the residual coefficient β. The fixed set contains 231

Figure · 원문 PDF 8쪽 · Figure 3: Held-out validation used to select the residual coefficient β. The fixed set contains 231

한 문장 요약

긴 문맥 증거 집계 과제에서 토큰 수준 교사 우선도를 응답 수준 검증자 결과와 그룹 정규화 잔여(residual)로 보정하고, 그 잔여를 토큰별 상대 OPD 이점으로 분배하는 GC-OPD 방법을 제안해 교사-검증자 불일치 문제를 완화한다.

해결하려는 문제

온-폴리시 증류(OPD)는 학생이 생성한 토큰들에 대해 교사의 토큰 수준 우도를 밀도 있게 제공하지만, 긴 문맥(task)에서는 토큰별 교사 신호가 국소적으로 그럴듯하나 입력 전체에 분포한 증거를 누락하거나 전역 제약을 위반하는 응답을 선호할 수 있다. 반면 태스크별 검증자(verifier)는 응답 단위의 성공 여부(및 부분 성공)를 평가하므로, 토큰 수준 OPD 점수와 검증자 보상 간 불일치(teacher–verifier disagreement)가 발생하면 OPD 기반 업데이트가 잘못된 응답 선호를 강화할 수 있다. 본문은 이 불일치의 진단, 그리고 이를 보정하는 효과적인 인터페이스 설계 문제를 다룬다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(주 텍스트 및 부록)을 기반으로 작성되었음. 모든 수치·설정(예: 표의 점수, β=0.10, τG/τT=1e-6, amax=[-10,10], 훈련 구성)은 본문과 부록에서 직접 확인한 내용을 사용했다. 코드·추가 구현 세부사항은 논문이 링크한 저장소(저자 제공)를 참조해야 하며, 일부 미세한 엔지니어링·하이퍼파라미터 튜닝 관행은 본문에 상세히 기술되지 않아 재현 시 추가 조정이 필요할 수 있다.