arxiv-wiki

Drive the Thoughts: Runtime Monitoring of VLA Reasoning-Trajectory Consistency

← 2026-09-01 목록으로 돌아가기

한 문장 요약

비전-언어-액션(VLA) 모델이 생성한 체인오브생각(CoT)을 러닝타임 사양으로 삼아, 생성된 주행 궤적이 CoT와 일치하는지를 자동으로 검증하는 모니터링 방법과 벤치마크(DriveAlignBench)를 제안하고 평가했다.

해결하려는 문제

현대의 통합형 주행 VLA는 자연어 형태의 추론(CoT)과 저수준 궤적을 동시에 출력하지만, (1) CoT가 장면에 근거한 신뢰할 만한 사양인지(신뢰성 문제)와 (2) CoT의 장면-상대적 약속을 궤적(저수준 ego-motion)과 어떻게 의미론적으로 비교해 불일치를 검출할지(표현 격차 문제)가 해결되지 않아 런타임 검증·모니터링이 어렵다. 본문에서는 이 두 가정을 검증하기 위해 RQ1(신뢰성 비율), RQ2(어떤 의사결정에서 신뢰성이 낮은가), RQ3(모니터들이 일치성 판별을 얼마나 잘하는가), RQ4(일치성 불일치가 안전성과 연관되는가)를 연구한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문, 그림, 표)을 근거로 작성되었음. 수치(예: 데이터 크기, 신뢰성·정합성 비율, 모니터 성능 지표, 혼동행렬)는 논문 표와 본문에서 직접 인용함. 프롬프트 상세 내용이나 저장소 내부 구현(예: 전체 문구 사전, 프롬프트 텍스트)은 본문에 요약되어 있으나 실제 코드·프롬프트는 공개된 GitHub 리포지토리에서 확인해야 하며, 호스티드 모델의 내부 동작·비결정성 등은 논문에 보고된 실험 절차를 그대로 인용했음.