arxiv-wiki

Post-Training Language Models for Gold-Medal Performance in Coding Competitions

← 2026-09-04 목록으로 돌아가기

한 문장 요약

경쟁적 프로그래밍 성능 향상을 목표로 대규모 문제 큐레이션, 합성 추론 트레이스 기반 SFT, 실행 보상 기반 RL, 그리고 반복적 실행-피드백 기반 추론(GenCorrect)을 결합한 후처리 파이프라인을 제안하여 IOI에서 금메달급 성능을 달성했다.

해결하려는 문제

기존 대규모 언어모델(LLM)은 경쟁적 프로그래밍에서 요구되는 알고리즘 설계, 제약에 따른 효율성 reasoning, 숨겨진 테스트 통과 같은 종합적 능력을 체계적으로 달성하기 어렵고, 개별 구성요소(SFT, RL, 테스트타임 대규모 샘플링 등)가 성능에 기여하는 바가 분리되어 있지 않다. 본 논문은 어떤 훈련·추론 조합으로 국제대회(예: IOI) 수준의 금메달 성능을 달성할 수 있는지를 규명하고 실전 대회 환경에서 시스템을 평가하는 것을 문제로 삼는다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 본 분석은 제공된 논문 PDF 본문(페이지 및 부록 포함)에 근거하여 작성되었음. 모든 수치·설정·절차는 본문과 부록에서 직접 추출한 내용만을 사용했으며, 논문이 명시적으로 언급하지 않은 내부 하이퍼파라미터나 추가 구현 세부사항은 생성하지 않았음. 라이브 실행의 정확한 실시간 자원 사용량(피크 GPU 수 등)과 일부 표의 세부 숫자는 본문에 제시된 값을 따랐으며, 논문 외부 검증(예: 공식 IOI 랭킹 포함 여부)은 수행하지 않았음.