arxiv-wiki

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

← 2026-08-06 목록으로 돌아가기

한 문장 요약

질의 문맥에 따라 3D/2D 입력 모달리티를 동적으로 선택(SMART)하고 모달리티-특화 전문가로 토큰을 라우팅(MAGE)하여 3D 장면 이해 성능과 효율을 향상시키는 통합 MLLM 프레임워크.

해결하려는 문제

기존 MLLM들은 고정된 모달리티 조합으로 모든 질의에 동일한 입력을 제공하므로, 질의별로 유효한 모달리티가 다름에도 불구하고 불필요한 모달리티가 잡음과 계산 낭비를 유발하고 중요한 모달리티가 충분히 활용되지 않음. 연구 질문은 “질의 의미에 따라 어떤 모달리티를 사용할지 동적으로 선택하고, 선택된 모달리티 정보를 LLM 내부에서 모달리티-일관성 있게 처리(전문가 특화)하려면 어떻게 설계하고 학습할 것인가”이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Motivation of SmartMage. (a) Different question types exhibit inherent modality preferences. (b) Previous MLLMs fuse

Figure · 원문 PDF 1쪽 · Figure 1: Motivation of SmartMage. (a) Different question types exhibit inherent modality preferences. (b) Previous MLLMs fuse

Figure 2: Overview of SmartMage. The omni-modal feature extractor first encodes text, RGB, depth, BEV, point cloud, and

Figure · 원문 PDF 3쪽 · Figure 2: Overview of SmartMage. The omni-modal feature extractor first encodes text, RGB, depth, BEV, point cloud, and

Figure 3: Details of the Modality Quality Evaluator. We

Figure · 원문 PDF 4쪽 · Figure 3: Details of the Modality Quality Evaluator. We

근거 범위: 본 분석은 제공된 논문 PDF 본문(메인 텍스트, 표, 그림, 부록 요약 포함)을 근거로 작성되었음. 본문에 명시된 수치(성능 지표, 하이퍼파라미터, 구조·학습 설정, 전처리 구성 등)를 직접 인용했으며, PDF 레이아웃/중복 페이지로 인한 OCR 표현의 일부 기호적 왜곡은 문맥으로 보정함. 구현 세부(예: 정확한 코드 경로, 내부 초기화 시드)나 PDF에 상세히 기술되지 않은 추가 하이퍼파라미터는 작성하지 않았으므로 재현 시 논문 부록과 공개 코드(프로젝트 페이지)를 함께 참고할 것을 권고함.