arxiv-wiki

Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models

← 2026-08-18 목록으로 돌아가기

한 문장 요약

학습 재훈련 없이 추론 단계에서 분류기-프리 가이던스(CFG) 변형들을 재평가하여, 최신 rectified-flow transformer 기반 텍스트-투-이미지 모델들에서 기존 제안들이 CFG를 일관되게 능가하지 못함을 보였다.

해결하려는 문제

기존의 CFG 대체 또는 개선 기법들은 주로 U-Net 계열과 전통적 이미지 품질 지표(FID, CLIP 등)에서 제안·검증되었고, 이 지표들은 생성 이미지의 구성적 정렬(compositional alignment)이나 프롬프트-이미지 의미 대응을 충분히 평가하지 못한다. 또한 많은 방법들이 서로 다른 모델·해상도·샘플러·데이터셋에서 보고되어 비교가 어렵다. 본 논문은 이러한 훈련 없는(guidance-at-inference) CFG 계열의 8개 방법을 동일한 프로토콜과 구성으로 재평가하여 실제로 현대 transformer 기반 모델들에서 CFG를 대체할 수 있는지 검증하려고 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(제공된 텍스트)를 근거로 작성되었다. 표, 부록(하이퍼파라미터 표·세부 벤치마크 표)과 본문 문장을 직접 인용하여 수치와 절차를 기술했으며, 본문에 명시되지 않은 구현 상세나 추가 실험 결과는 생성하지 않았다. 이미지 예시의 세부 픽셀 내용은 캡션과 본문 설명을 통해서만 확인했으며 그 외 시각적 세부는 원문 그림을 직접 참조해야 한다.