arxiv-wiki

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

← 2026-08-09 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Motivation and mechanism of DASH. (a) The current local divergence Dt is weakly associated with the mean future

Figure · 원문 PDF 2쪽 · Figure 1: Motivation and mechanism of DASH. (a) The current local divergence Dt is weakly associated with the mean future

Figure 2: Overview of DASH. A privileged teacher evaluates a student-generated rollout to produce local distillation signals.

Figure · 원문 PDF 4쪽 · Figure 2: Overview of DASH. A privileged teacher evaluates a student-generated rollout to produce local distillation signals.

Figure 3: Component ablations of DASH on Qwen3-1.7B. (a) Fixed values of the propagation coefficient λ test adaptive against

Figure · 원문 PDF 7쪽 · Figure 3: Component ablations of DASH on Qwen3-1.7B. (a) Fixed values of the propagation coefficient λ test adaptive against

한 문장 요약

긴 시퀀스 추론에서 토큰별 분포적 자기증류(OPSD)가 시간적 불일치(teacher–student divergence)의 경로 정보를 활용하지 못하는 문제를 해결하기 위해, 각 위치의 지역적 발산과 시퀀스 평균의 차이를 이용해 적응적 전파 게이트를 만들고 역방향 다단계 집계를 통해 토큰별 감독 가중치와 유효 감독 지평선을 동적으로 조정하는 DASH 방법을 제안한다.

해결하려는 문제

문제: RLVR(검증 가능한 보상)를 통한 추론 능력 향상은 최종 답의 정답 여부 등 시퀀스 수준의 희소한 보상에 의존하므로 긴 추론 경로에 대한 시점별 기여도 할당(temporal credit assignment)이 어렵다. 기존의 on-policy self-distillation(OPSD)은 학생이 생성한 접두사들에 대해 교사 분포로부터 밀집(token-level) 분포 감독을 제공해 희소성 문제를 완화하지만, OPSD는 모든 위치의 지역적 발산(local divergence)에 동일한 계수(예: 1/T)를 부여하여 동일한 지역 발산값이지만 서로 다른 과거 불일치 이력을 가진 경우를 구분하지 못한다. 연구 질문: 지역적 발산 값의 시간적 배열(경로)이 감독 가중치 배분에 유의미하므로, 이 경로 정보를 이용해 토큰별 감독 가중치와 감독 지평선을 적응적으로 조정하면 성능 향상이 가능한가?

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문, 그림, 표, 부록 포함)에 기초하여 작성되었음. 본문과 부록의 수치·설정(하이퍼파라미터, 데이터셋, 모델, 표의 정량값 등)을 그대로 인용했으며, 논문에 명시되지 않았거나 본문에서 명확히 제시되지 않은 구현 세부사항이나 통계적 유의성 주장은 추가하지 않았음. 일부 비교값(Base, SFT, GRPO)은 논문이 외부에서 인용한 결과임을 부록 B에서 명시하고 있으므로 해당 항목들과의 직접 비교는 논문에서 사용한 ‘matched rerun’ 프로토콜과 구분되어야 함.