arxiv-wiki

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

← 2026-08-22 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Overview of RoMAN-Flow. RoMAN-Flow adopts an invertible AR-NF architecture that maps continuous action chunks

Figure · 원문 PDF 3쪽 · Figure 1: Overview of RoMAN-Flow. RoMAN-Flow adopts an invertible AR-NF architecture that maps continuous action chunks

Figure 2: One-step policy distillation. The student model

Figure · 원문 PDF 5쪽 · Figure 2: One-step policy distillation. The student model

Figure 3: Qualitative results of RoMAN-Flow on MetaWorld,

Figure · 원문 PDF 5쪽 · Figure 3: Qualitative results of RoMAN-Flow on MetaWorld,

한 문장 요약

자기회귀(normalizing) 흐름(AR-NF)을 정책 표현으로 사용하되, 학습 시 샘플링을 피하는 이점-가중 우도 최적화(NF-IQL)와 추론 시 순차적 역변환을 제거하는 일단계(distillation)로 현실적 오프라인 로봇 조작 강화학습을 실현한 RoMAN-Flow 프레임워크.

해결하려는 문제

기존의 확산(diffusion) 및 flow-matching 정책은 고성능 생성 능력을 보이지만 학습·사후 최적화에서 ‘저비용의 정확한 조건부 우도(likelihood)’를 제공하지 못해 우도 기반 오프라인 RL에 직접 활용하기 어렵다. 반면 AR-NF는 정확한 우도를 제공하지만 역변환(inverse)·샘플링이 자기회귀적으로 순차 생성되므로 정책 최적화(actor 업데이트)와 배포(추론)에서 큰 샘플링·지연 비용을 초래한다. 연구 질문은 ‘AR-NF의 정확한 우도 이점을 유지하면서 오프라인 RL의 정책 최적화 단계와 실제 배포 단계의 샘플링 병목을 어떻게 해소할 것인가’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 논문 PDF 본문(제공된 페이지 1–15)을 근거로 분석함. 본 분석의 수치(성능 표, 모델 크기, 레이턴시, 하이퍼파라미터 등)는 본문 표·본문 문장에 명시된 값을 그대로 사용했음. 추가적인 구현 세부사항(예: 정확한 GPU 시간·플로팅 연산량, 학습에 사용된 정확한 하드웨어 비용)은 본문에 명시되어 있지 않아 포함하지 않았음.