arxiv-wiki

Puro-2B: Poor Lab’s Qwen2-1.5B Trained on RTX 5090 within $5090

← 2026-08-28 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Model performance versus reproduction cost under the accounting protocol in Sections 2.2 and 4.3.2.

Figure · 원문 PDF 1쪽 · Figure 1: Model performance versus reproduction cost under the accounting protocol in Sections 2.2 and 4.3.2.

Figure 2: (a) Relative cost-efficiency improvement for hardware, FP8 precision, MuonH, and various Phase 2

Figure · 원문 PDF 5쪽 · Figure 2: (a) Relative cost-efficiency improvement for hardware, FP8 precision, MuonH, and various Phase 2

Figure 3: Puro-2B pipeline for poor-lab design. The upper row presents the work flow in common practice,

Figure · 원문 PDF 6쪽 · Figure 3: Puro-2B pipeline for poor-lab design. The upper row presents the work flow in common practice,

한 문장 요약

RTX 5090과 블록단위 FP8, MuonH(하이퍼볼) 최적화 및 Curriculum Model Averaging을 조합한 저비용(수천 USD) 오픈형 2B규모 사전학습 레시피를 제시하고, 이를 통해 최대 1.4T 토큰으로 훈련한 PuRo-2B 컬렉션을 공개·평가하여 비용대성능 곡선과 레시피별 이득을 분석했다.

해결하려는 문제

대형 언어 모델 사전학습은 높은 비용 때문에 많은 학계·오픈소스 연구실에서 재현·연구가 불가능하다. 기존 오픈-레시피/오픈-웨이트 노력들이 존재하지만 재현 가능한 전(全)파이프라인을 저비용·범용 하드웨어로 돌릴 수 있는 실용적 레시피가 부족하다. 본 논문은 소비자급 GPU 환경(주로 RTX 5090)에서 비용을 수천 달러 수준으로 낮추면서도 Qwen2-1.5B 수준의 성능에 근접하는 재현 가능한 사전학습 파이프라인을 제시하는 것을 목표로 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(주요 본문 및 부록 일부 포함)으로부터 직접 추출·요약한 내용에 기반함. 본문에 명시된 수치(토큰 수, GPU 수, GPU-h, 비용, 체크포인트 스텝 등)와 방법적 세부사항을 우선적으로 사용했으며, 저자가 비공개로 처리한 드라이버 수정의 구체적 구현 세부사항이나 부록의 일부 세부 실험결과가 PDF 추출에 일부 누락되어 있을 가능성을 명시함. 불확실하거나 본문에서 직접 확인되지 않은 구현·성능 수치는 생성하지 않았음.