arxiv-wiki

Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering

← 2026-08-19 목록으로 돌아가기

한 문장 요약

MemTree3D라는 실시간 구축 가능한 경량 3D 장면 트리 표현을 사용해 LLM이 장면을 추론하여 위치·공간 단서를 생성하고, 그 단서로 질문 관련 키 프레임을 빠르게 선택해 VLM에 전달함으로써 대규모 비디오 전수 검색 없이 효율적이고 정확한 3D 질문 응답을 달성한다.

해결하려는 문제

기존 3D 질문응답 방법은 (1) 영상 길이에 비례해 VLM 계산·메모리 비용이 급증하는 멀티프레임 VLM, (2) 객체 수준의 장면 그래프로 세부 시각 정보가 손실되는 방법, (3) 각 쿼리마다 수천 프레임을 대상으로 객체 기반 비주얼 서치를 반복 수행해 대기시간이 큰 비주얼 서치 기반 키프레임 선택이라는 한계가 있다. 이 논문은 실시간 상호작용이 필요한 임베디드(embodied) 시나리오에서 쿼리별 전체 비디오 재처리 없이도 정확한 답을 내는 효율적 키프레임 선택 방식을 제안한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문 표, 그림, 알고리즘 및 부록 포함)의 텍스트를 근거로 작성했습니다. 표와 본문에서 보고된 수치(예: OpenEQA LLM-Match 향상, ScanQA/SQA3D EM@1 변화, Tthres/Rthres, key:cue 가중치, 실시간 25+ FPS, 69.2% 런타임 향상 등)는 PDF의 표·그림·본문 문장을 직접 인용해 정리했습니다. 하드웨어 상세(정밀 GPU 모델 등)나 일부 런타임 조건의 미세한 측정 절차는 논문에 구체적 수치로 명시되지 않아 본 분석에서는 기술하지 않았습니다.