arxiv-wiki

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

← 2026-08-15 목록으로 돌아가기

한 문장 요약

운전 영상 검색을 위해 일반 목적 멀티모달 임베딩을 운전 도메인 캡션으로 적응시킨 뒤, 훈련 시 특권 신호로서 자차(ego) 궤적 유사도를 GRPO로 보상하여 영상 임베딩이 차량 운동(가속·감속·회전 등)에 민감하도록 학습하는 TraVEL을 제안한다.

해결하려는 문제

대규모 자율주행 로그에서 원하는 주행 시나리오를 효율적으로 검색하려면 단일 벡터 인덱스로 빠르게 탐색 가능한 멀티모달 임베딩이 유리하다. 그러나 일반 목적 비디오–텍스트 임베딩은 정적 장면 단서에 의존하는 단축 경로를 활용해 가속/감속, 좌/우 회전 등 운동 기반의 미세한 구분에 취약하며, 구조화된 규칙 기반 시스템은 설계·보정 비용과 보조 인식 모듈 의존성이 크다. 본 연구는 일반 목적 임베딩 모델을 운전-비디오 검색에 적응시켜 운동 민감성을 확보할 수 있는지 탐구한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 본 분석은 제공된 논문 PDF 본문 전체 텍스트를 기반으로 작성되었으며, 모든 수치(표와 본문에 제시된 하이퍼파라미터 및 평가 결과)는 PDF에서 직접 확인 가능한 값만을 사용했다. 논문에 명시되지 않은 학습 계산량(예: GPU 시간), 추가 구현 세부사항, 외부 데이터(예: DVGT로 궤적 추정 시의 성능) 등은 추정하지 않았음을 밝힌다.