Post-Training Language Models for Gold-Medal Performance in Coding Competitions
- 게시일: 2026-09-04
- arXiv: 2609.02849v1 · PDF
- 저자: Aleksander Ficek, Sean Narenthiran, Mehrzad Samadi, Somshubra Majumdar, Boris Ginsburg
- 분야: cs.LG, cs.AI, cs.CL, cs.MA, cs.SE
- 선정 점수: 5.26
- 선정 이유: 최근성 0.8, 인용 영향 0.0 (인용 0회), 저자 영향 0.0 (최고 h-index 0), AI 주제 적합성 3.0, 개발자 관심 0.0, 학술 신호 0.3, 오픈 웨이트·주요 연구조직 신호 1.2
← 2026-09-04 목록으로 돌아가기
한 문장 요약
경쟁적 프로그래밍 성능 향상을 목표로 대규모 문제 큐레이션, 합성 추론 트레이스 기반 SFT, 실행 보상 기반 RL, 그리고 반복적 실행-피드백 기반 추론(GenCorrect)을 결합한 후처리 파이프라인을 제안하여 IOI에서 금메달급 성능을 달성했다.
해결하려는 문제
기존 대규모 언어모델(LLM)은 경쟁적 프로그래밍에서 요구되는 알고리즘 설계, 제약에 따른 효율성 reasoning, 숨겨진 테스트 통과 같은 종합적 능력을 체계적으로 달성하기 어렵고, 개별 구성요소(SFT, RL, 테스트타임 대규모 샘플링 등)가 성능에 기여하는 바가 분리되어 있지 않다. 본 논문은 어떤 훈련·추론 조합으로 국제대회(예: IOI) 수준의 금메달 성능을 달성할 수 있는지를 규명하고 실전 대회 환경에서 시스템을 평가하는 것을 문제로 삼는다.
핵심 기여
- 대회 문제 22,000개를 포함한 대규모 경쟁적 프로그래밍 코퍼스를 수집·검증하고 실행 가능한 평가 환경으로 패키징한 점
- DeepSeek-V4-Flash / GLM-5.2 등으로 생성한 합성 추론 트레이스(1.2M / 477,642 예)를 활용한 장문 SFT 파이프라인을 구축하고 Nemotron-3 계열 모델에 적용한 점
- 실행 기반 이진 보상으로 작동하는 GRPO 기반의 실행-검증 강화학습(RL)을 Nano 모델에 적용해 성능 개선을 도모한 점
- GenCorrect라 명명한 반복적 테스트타임 연산 전략을 제안하여 대규모 샘플링·클러스터링·실행 피드백을 통해 50회 제출 제한 하에서 점진적 개선을 달성한 점
- IOI 2026 실환경(인터넷 제한·제출 제한·시간 제한)에서 경쟁 전용 Ultra-CC 시스템을 실시간으로 운용해 최고 인간 점수를 초과한 결과를 보고한 점
접근 방법
- 아키텍처: Nemotron-3-Nano-30B-A3B(총 30B, 활성 파라미터 3B)와 Nemotron-3-Ultra-550B-A55B(총 550B, 활성 55B)를 기반으로 후처리 모델(Nano-CC, Ultra-CC)을 만듦.
- 학습 데이터: 22,000개의 큐레이션된 문제에서 실행 가능한 환경을 생성·검증하고, DeepSeek-V4-Flash와 GLM-5.2 등으로 합성 reasoning trace를 생성( Nano용 1.2M, Ultra용 477,642 ).
- SFT: Nano는 3 epoch(글로벌 배치 64, 최대 시퀀스 길이 262K), Ultra는 1 epoch로 장문 SFT 실시(테이블5 참조).
- RL: Nano에 한해 실행 가능 문제 3,219개(학습 2,847, 검증 372)를 대상으로 NeMo RL의 Group Relative Policy Optimization(GRPO)를 사용해 학습(스텝당 64 프롬프트 × 16 롤아웃 = 1,024 롤아웃, 온도 1.0, 최대 생성 길이 ~255K 토큰, 보상은 전부 정답이면 1, 아니면 0).
- 추론(GenCorrect): 최대 5 라운드, 각 라운드 최대 200 후보 생성(초기 라운드), 각 라운드에서 컴파일·필터링 후 토큰-셔플 기반 유사도와 score-blind 휴리스틱 Q(c)에 따라 K=10 클러스터 중심을 선택하고 각 중심 대표 10개를 제출(IOI는 서브태스크별 점수 피드백 사용).
- 최종 라운드(대회용)는 후보를 1,000개로 확대하고 생성기/검증기 기반 테스트 입력 생성 후 실행으로 상위 10개를 선택.
- 실전 배포: NVFP4 양자화(여러 KV-cache·MTP 설정)로 처리량을 높여 실시간 경쟁 환경에서 운용함.
주요 결과
- 데이터셋/벤치마크: IOI 2025(6문제, 총 600점, 서브태스크별 부분점수), ICPC 2025(12문제, 이진 채점), LiveCodeBench Pro(LCB Pro). 평가 시 SFT/RL 데이터에서 IOI2025/ICPC2025/LCB Pro 문제들을 제외·중복 제거함.
- Nano-CC(IOI 2025): 베이스 Nemotron-3-Nano Score@1 130점(21.7%) → SFT 후 262–291 범위(논문은 최종 Score@1 291, 정규화 48.5%) → GenCorrect 5라운드 후 468점으로 금메달 기준(438.3) 초과. Score@200(병렬샘플링)도 272→461로 개선.
- Ultra-CC(IOI 2025): 베이스 Nemotron-3-Ultra Score@1 304(45.5%) → SFT(1 epoch) 후 50.7%(304→? 표와 그림에서 SFT 후 304→304? 논문은 최종 Score@1 50.7%로 보고) 및 GenCorrect 5라운드 후 502.0점.
- 표1(단일 샘플 기준): Nano-CC IOI Score@1 48.5%, ICPC Pass@1 51.0%, LCB Pro Pass@1 71.6%. Ultra-CC IOI Score@1 50.7%, ICPC Pass@1 57.4%, LCB Pro Pass@1 74.5%. 비교모델들(예: GLM-5.2, DeepSeek 등)과 함께 제시됨.
- RL 효과: Nano에 대해 GRPO로 RL 적용 시 SFT 이후에 IOI Score@1이 46.7%→48.5%, ICPC 47.3%→51.0%, LCB Pro 70.7%→71.6%로 소폭 개선. RL만으로는 SFT의 대규모 이득을 대체하지 못함(Fig.7).
한계
- 저자가 명시한 한계: 방법은 막대한 훈련 및 테스트타임(추론) 연산을 요구하므로 실험은 시스템-레벨 비교이며 인간과의 동일 자원 비교가 아님. 계산 제약으로 Ultra에 대한 RL 훈련을 수행하지 못했고(따라서 RL의 규모 확장 효과 미검증), 모델 스케일·훈련 단계에 대한 완전한 소멸(ablations)을 수행하지 못함. 또한 결과가 경쟁적 프로그래밍 영역 밖으로 일반화될지 불확실함.
- 본문에서 확인되는 추가 제약: SFT 교사와 생성 길이(예: GLM-5.2가 DeepSeek-V4-Flash보다 출력 길이가 짧아 최종 생성 처리량에 영향)를 포함해 실전 배포에서는 양자화·MTP·KV-cache 설정 등 실용적 트레이드오프가 필요함. 평가 관련: IOI 2026 라이브 런은 비공식·비감독(논문에서 명시)으로 공식 순위에 포함되지 않음.
- 데이터 공개 제한: 전체 훈련 코퍼스는 제3자 재배포 제한으로 공개 불가하다고 명시되어 있어 완전 재현에는 제약이 있음.
개발자 관점
- 재현성: 저자들은 NeMo-Skills를 통해 체크포인트와 분배 가능한 추론·평가 레시피를 공개할 예정이나 전체 훈련 데이터는 공개 불가. 따라서 재현 시 SFT 교사 데이터와 실행 가능한 문제 환경 구축 절차(본문·Appendix A)를 충실히 따라야 함.
- 인프라·비용: 라이브 평가에는 최대 760 NVIDIA GB300 GPU를 피크로 사용했으며(실시간 운영), SFT와 RL도 다수의 GB300 GPU(예: Nano SFT 64GPU, Ultra SFT 128GPU)를 요구하므로 높은 HW 비용이 필요함.
- 추론 최적화: NVFP4 양자화(예: FP8 KV-cache, MTP=5)는 토큰/s/GPU를 여러 배로 늘려 대규모 후보 생성(GenCorrect) 실현에 필수적이나 Score@1에서 일부 손해를 감수함. 실전 환경에선 양자화·캐시 정책·최종 라운드 후보 풀 확장(1,000개)과 실행 기반 랭킹 절차를 조합해 단일 런 성능을 최적화할 수 있음.
- 데이터·교사 선택: SFT 교사(예: GLM-5.2 vs DeepSeek-V4-Flash)는 출력 길이와 품질 측면에서 최종 SFT 효과와 추론 처리량에 영향을 미침. 따라서 SFT 교사 선정과 출력 길이 제어는 실용적 중요한 설계 변수임.
- RL 설계: 실행 기반 이진 보상은 성공/실패만을 단기 보상으로 제공하므로 긴 생성-실행 경로의 크레딧 할당 문제가 존재함. GRPO 등 집단 상대정책 기법을 사용했지만, RL은 SFT 후 파인튜닝적 보완으로 제한적인 개선을 보였음. 따라서 실행 보상 기반 RL을 설계할 때는 성공-실패가 섞이는 문제 선정, 실행 시간 제한(논문은 연속 실행 300초 기준 필터링) 및 롤아웃 규모 관리가 필요함.
근거 범위: 본 분석은 제공된 논문 PDF 본문(페이지 및 부록 포함)에 근거하여 작성되었음. 모든 수치·설정·절차는 본문과 부록에서 직접 추출한 내용만을 사용했으며, 논문이 명시적으로 언급하지 않은 내부 하이퍼파라미터나 추가 구현 세부사항은 생성하지 않았음. 라이브 실행의 정확한 실시간 자원 사용량(피크 GPU 수 등)과 일부 표의 세부 숫자는 본문에 제시된 값을 따랐으며, 논문 외부 검증(예: 공식 IOI 랭킹 포함 여부)은 수행하지 않았음.