arxiv-wiki

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

← 2026-08-08 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: The paradox of visual tool-use. (a) Our

Figure · 원문 PDF 1쪽 · Figure 1: The paradox of visual tool-use. (a) Our

Figure 2: Causal graph for visual tool-use. (a) The single-step causal graph for a single tool-use step over

Figure · 원문 PDF 3쪽 · Figure 2: Causal graph for visual tool-use. (a) The single-step causal graph for a single tool-use step over

Figure 3: Three-level causal intervention. (a) Policy-level intervention (§3.3.1) toggles the entire T →O →Y

Figure · 원문 PDF 4쪽 · Figure 3: Three-level causal intervention. (a) Policy-level intervention (§3.3.1) toggles the entire T →O →Y

한 문장 요약

생성형 멀티모달 모델의 ‘thinking-with-images’(crop-and-zoom 등) 동작이 실제로 예측에 인과적으로 기여하는지를 세 단계(정책/궤적/단계) 개입과 계량적 지표(Visual Evidence Gain)로 진단해, 집계적 성능 개선이 소수의 ‘캘리브레이티드’ 롤아웃에 집중되어 있음을 밝힌 논문.

해결하려는 문제

문제: thinking-with-images 패러다임은 모델이 이미지에 대해 능동적 시각 연산(예: crop-and-zoom)을 수행하게 하여 미세 증거를 획득한다는 직관에 기초하지만, 실험에서는 도구 호출(툴-유즈)이 직접 추론(direct inference)에 비해 토큰 비용은 크게 증가시키는 반면 정확도 향상은 작거나 음수인 경우가 많고, 종종 동일 문항에서 반복적으로 무의미한 크롭을 수행하여 오히려 실패하는 사례가 관찰됨. 핵심 연구 질문은 ‘반환된 시각적 관찰(visual evidence)이 최종 정답에 인과적으로 영향을 주는가?’ 이며, 관찰에 의한 경로(observation-mediated)와 행동에 의한 지름길(action-induced shortcut)을 골격으로 분리해 인과적으로 규명하는 것이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 분석 근거: 본 응답은 사용자가 제공한 논문 PDF 본문(본문과 부록 포함)의 텍스트를 기반으로 작성함. 표와 그림의 수치(예: Table 1–5, Fig.1–5 및 부록 표)는 PDF에서 추출된 값을 그대로 인용했으며, 일부 표 형식(특히 VEG 관련 표)의 열 레이아웃이 압축되어 읽기 어려운 부분이 있었으므로 VEG의 평균값·분할 통계는 본문과 표의 서술적 설명을 우선해 요약했음. 닫힌 소스 모델에의 적용 가능성, 학습-레벨 원인 규명(RL-trap) 등은 논문이 명시한 바와 같이 미확정(hypothesis)임을 명시함.