arxiv-wiki

RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

← 2026-08-09 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Motivation of reasoning-pivot-guided transfer.

Figure · 원문 PDF 1쪽 · Figure 1: Motivation of reasoning-pivot-guided transfer.

Figure 2: Overview of the RP-OPSD pipeline. RP-OPSD constructs on-policy target-language rollouts, compares

Figure · 원문 PDF 4쪽 · Figure 2: Overview of the RP-OPSD pipeline. RP-OPSD constructs on-policy target-language rollouts, compares

Figure 3: Cross-lingual solution reachability on Poly-

Figure · 원문 PDF 7쪽 · Figure 3: Cross-lingual solution reachability on Poly-

한 문장 요약

영어 참조 해답의 유무로 구분되는 교사 분포의 토큰별 분포 차이를 DKL로 측정해 ‘Reasoning-Pivot Transfer(RPT)’ 게이트를 만들고, 이 게이트로 온-폴리시 자기증류를 이유 결정 위치(피벗) 중심으로 라우팅하여 다국어 수학적 추론 성능을 향상시키는 RP-OPSD 방법을 제안한다.

해결하려는 문제

대규모 언어모델의 연쇄추론(Chain-of-Thought) 능력은 영어 등 고자원 언어에서 잘 발현되지만 저자원 언어로의 전이는 불균형하다. 기존 방법들(SFT 번역 라벨링, RL 기반 보상, OPSD의 균일 토큰 가중치 등)은 타겟 언어의 표면적 실현(surface text)과 실질적 추론 결정을 구분하지 못해 전이 가능한 핵심 추론 신호(pivots)를 우선적·선택적으로 감독하지 못한다. 본문은 어떤 토큰에 더 강한 특권(privileged) 증류를 적용해야 하는지를 식별하는 문제(어디를 전송할 것인가)를 다룬다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트 및 부록 포함)을 기반으로 작성했다. 표와 그림의 수치(예: 표 1, 표 2, 표 4, 표 8, 그림 6)는 본문·부록에서 직접 인용했으며, 논문에 명시되지 않은 임의의 실험 시드·학습 시간·정확한 GPU 비용 등은 추정하지 않았다. 구현 세부(예: 전체 학습 클럭 타임)는 본문에 나타나지 않아 평가에 포함되지 않았다.