arxiv-wiki

Inject, Align, Recover: Staged Post-Training for Retrieval-Free Document Knowledge Internalization

← 2026-08-21 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: The overview of IAR. Vanilla SFT learns from generated QA pairs and covers only the facts selected by those questions.

Figure · 원문 PDF 2쪽 · Figure 1: The overview of IAR. Vanilla SFT learns from generated QA pairs and covers only the facts selected by those questions.

Figure 2: BudgetMatch-to-IAR movement. Right is higher

Figure · 원문 PDF 5쪽 · Figure 2: BudgetMatch-to-IAR movement. Right is higher

Figure 3: Pre-recovery domain gains from Inject+Align. CCI

Figure · 원문 PDF 6쪽 · Figure 3: Pre-recovery domain gains from Inject+Align. CCI

한 문장 요약

제한된 문서 코퍼스를 모델 파라미터로 내재화해 검색 없이 문서 기반 질의응답을 수행하도록, 문서 노출(Inject), QA 정렬(Align), 그리고 일반 능력 회복(Recover)을 단계적으로 분리한 사후학습 프레임워크 IAR을 제안한다.

해결하려는 문제

기존 방법은 (1) 질의응답 전용 감독(SFT)은 학습 신호가 희소해 문서 전체 사실을 충분히 노출시키지 못하고, (2) 단순한 continued pretraining(CPT)은 문서 텍스트를 밀도있게 학습하지만 QA 인터페이스로의 접근성(질문-응답 형태로 쓰는 능력)을 직접적으로 가르치지 못하며, (3) 도메인 적응은 일반 지시(인스트럭션) 능력의 저하(망각)를 초래해 배포 가능성에 문제가 있다는 점에서 한계를 가진다. 본문은 ‘검색 없이(조회문서 미제공) 고정 코퍼스로부터 문서 지식을 파라미터로 내재화’하는 문제(문서 지식 내부화)를 다룬다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트 및 보충자료)을 근거로 작성되었음. 실험 수치·설정·알고리즘 설명은 PDF에 명시된 값만을 사용했다. 재현 관련 일부 실행 인자(특히 Qwen 스케일링 일부 행의 원시 학습 인자·로그)는 아카이브에 완전하게 보존되어 있지 않다고 본문이 밝히므로(Scaling-run provenance 부문) 그 부분의 세부 재현 가능성은 제한적임. 또한 모든 체크포인트가 단일 런으로 보고되어 훈련-시드에 대한 안정성은 문서에서 확인할 수 없음을 명시한다.