arxiv-wiki

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

← 2026-08-13 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Left: Illustration of the referential ambiguity in standard image-level alignment (top), contrasted with

Figure · 원문 PDF 2쪽 · Figure 1: Left: Illustration of the referential ambiguity in standard image-level alignment (top), contrasted with

Figure 2: Overview of MMCS pretraining paradigm. We construct an interleaved image-text sequence by

Figure · 원문 PDF 3쪽 · Figure 2: Overview of MMCS pretraining paradigm. We construct an interleaved image-text sequence by

Figure 3: Data synthesis pipeline.

Figure · 원문 PDF 4쪽 · Figure 3: Data synthesis pipeline.

한 문장 요약

자연 이미지에서 참조 불명확성 문제를 해결하기 위해 텍스트 속 명사구(엔티티)를 대응하는 시각 객체 임베딩으로 대체하는 ‘MultiModal Code-Switching (MMCS)’라는 사전학습 패러다임을 제안하여 명시적 객체-엔티티 정렬을 유도한다.

해결하려는 문제

기존 MLLM의 모달리티 정렬은 이미지 전체를 하나의 전역 표현으로 압축한 뒤 긴 캡션을 예측하도록 학습하는 이미지-레벨 정렬에 의존한다. 자연 이미지는 여러 객체를 포함하기 때문에 전역 표현만으로는 텍스트 엔티티와 특정 시각 영역 간의 대응을 추론하기 어렵고(참조 불명확성), 이로 인해 데이터 비효율성과 표현의 의미적 접지(semantic grounding) 저하가 발생한다. 본 논문은 이러한 이미지-레벨 정렬의 한계를 해결하고 객체 수준의 명시적 대응을 제공하는 방법을 제시하는 것을 연구 질문으로 삼는다.

핵심 기여

접근 방법

주요 결과

데이터·품질 통계: 합성 데이터셋은 773,779 샘플, 총 5,145,630 객체, 평균 캡션 길이 961.65자, 평균 객체 수 6.65를 보고함(Table 4). VLM Judge(Gemini-3-Pro)와 인간 평가에 의한 객체 정렬 정확도는 평균 각각 0.949, 0.942로 보고되어 합성 라벨의 품질이 비교적 높음을 보임(Table 5).

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–21 및 부록)을 기반으로 작성되었으며, 본문에서 명시된 표와 그림(예: Table 1–15, Table 4–6, Figures 1–9)과 기술된 수치 및 문장들을 직접 인용해 요약하였습니다. 외부 코드·데이터 리포지터리나 추가 보충자료는 확인하지 않았고, 본문에 직접 명시되지 않은 구현 세부사항(예: 공개된 코드 위치, 모델 체크포인트 경로)은 포함하지 않았습니다.