arxiv-wiki

UE5M3 FP4 Block Scaling for Stable Language Model Pretraining

← 2026-09-04 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Step-30,000 checkpoint snapshot for the four final MLP mixer.down_proj modules.

Figure · 원문 PDF 9쪽 · Figure 1: Step-30,000 checkpoint snapshot for the four final MLP mixer.down_proj modules.

Figure 2: Training loss for the completed 8B runs. Lower is better. The split vertical axis keeps the

Figure · 원문 PDF 17쪽 · Figure 2: Training loss for the completed 8B runs. Lower is better. The split vertical axis keeps the

Figure 3: The final 5,000 optimizer steps. Curves use the same 250-step moving mean as Figure 2.

Figure · 원문 PDF 18쪽 · Figure 3: The final 5,000 optimizer steps. Curves use the same 250-step moving mean as Figure 2.

한 문장 요약

UE5M3 블록 스케일(E5M3)과 50-스텝 주기적 텐서 스케일링, 역전파의 업스트림 그래디언트에만 선택적 확률적 반올림을 적용하고 RHT를 생략해, UE5M3 블록-16 레시피로 Nemotron‑H 8B를 약 188.7B 토큰 동안 FP4로 안정적으로 사전학습했다.

해결하려는 문제

E2M1 페이로드를 쓰는 기존 FP4(E2M1+E4M3/MXFP4) 사전학습은 블록 스케일의 유효 범위가 좁아 스케일 선택·아웃라이어·반올림·누적 민감성 때문에 불안정하다. NVIDIA Transformer Engine의 NVFP4 레시피는 현재-텐서 스케일링(D=1), RHT(무작위 하다마드 변환), BF16 예외(final blocks) 등으로 안정화를 달성하지만, 이들 모두 FP4 GEMM 외부에서 추가 연산·복잡도를 늘린다. 논문은 더 넓은 블록-스케일(UE5M3)이 단순한 레시피로 FP4 사전학습을 안정화할 수 있는지 묻는다.

핵심 기여

접근 방법

주요 결과

한계

분석자 판단: 소프트웨어 probe-matched GEMM 에뮬레이션은 네이티브 출력의 여러 결정론적 검사에서 일치했으나, 다른 HW/드라이버/스택 변종에서는 누적·반올림·병렬 축약(ordering) 구현 차이로 행동이 달라질 수 있어 이식성/일반성에 제약이 있음(본문에서 accumulation-path sensitivity와 GPU-specific 규칙을 상세히 제시함).

분석자 판단: 데이터 믹스(82% DataComp-LM 등 내부 OLMo 대체)와 단일-호라이즌 단축 때문에 실제 공개 NVFP4 장기 결과와 직접 비교할 때 데이터·기간 차이가 결과에 영향을 줄 수 있음.

분석자 판단: 블록 크기(B=16 vs 32)와 GEMM 출력 모델(프로브 매칭 vs decoded-operand)에서 소규모 성능 차이가 관찰되어 하이퍼파라미터/수치 모델에 민감함(본문 실험 참조).

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(전체 페이지)에 근거해 작성되었음. 제시된 수치(학습 손실, NLL, 다운스트림 점수, 처리량 증감 등)는 본문 표와 서술을 직접 인용했으며, 저자가 명시한 한계와 본문에서 합리적으로 확인되는 한계를 구분해 표기했다. 하드웨어·드라이버별 미세 구현(예: GEMM 내부 스케줄링)에 관한 추가적인 일반화는 본문 외부 정보 없이 제한적으로 판단했음을 밝힌다.