arxiv-wiki

Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving

← 2026-09-05 목록으로 돌아가기

한 문장 요약

LaPla는 사전학습된 잔여 VQ-VAE 디코더를 동결해 물리적 궤적 사전(prior)을 제공하고, 멀티모달 VLM(Emu3)에 미래 행동 쿼리를 넣어 연속 잠재벡터를 병렬 예측한 뒤 동결된 디코더로 역변환하여 정밀하고 물리학적으로 타당한 연속 궤적을 생성하는 end-to-end Vision-Language-Action 프레임워크이다.

해결하려는 문제

기존 VLA(vision-language-action) 방식은 (1) 행동을 이산 토큰으로 토크나이즈하면 양자화 오차로 인해 장기 예측에서 오차가 증폭되어 폐루프에서 위험하고 불연속한 조향을 유발하고, (2) VLM과 플래너를 느슨하게 결합하면 고수준의 의미 추론과 저수준의 운동 제어 사이에 시공간적 불일치가 발생하며, (3) 확률적(예: 확산) 연속제너레이터는 연속적이고 운동학적으로 타당한 궤적을 만들 수 있으나 학습 불안정성과 반복적인 복원(denoising)으로 인한 추론 지연이 크다는 한계가 있다. 연구 질문은 ‘대규모 시맨틱/언어적 추론을 연속적이고 운동학적으로 타당한 행동으로 어떻게 안정적·효율적으로 정렬할 것인가’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–8, 표 및 그림 포함)을 근거로 작성되었다. 수치는 본문 텍스트와 표에서 직접 발췌했으며(예: 표 I–IV, 표 III의 재구성 수치), 일부 주장(예: ‘15.52% 감소’, ‘33.34 percentage points 향상’)은 논문의 초록 및 본문 비교 설명을 바탕으로 기재되었다. PDF 추출 과정에서 표의 일부 컬럼명이 축약되었거나 세부 하이퍼파라미터(예: 정확한 학습률, 에폭 수)는 본문에 명시되어 있지 않아 포함하지 않았다.