arxiv-wiki

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

← 2026-08-13 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: (a) Static methods operate on frozen parameters af-

Figure · 원문 PDF 1쪽 · Figure 1: (a) Static methods operate on frozen parameters af-

Figure 2: Test-Time Self-Evolving Framework consists of four core stages: Exploration, Evaluation, Reflection, and Internal-

Figure · 원문 PDF 4쪽 · Figure 2: Test-Time Self-Evolving Framework consists of four core stages: Exploration, Evaluation, Reflection, and Internal-

Figure 3: Illustration of Contrastive Calibration Method. Dur-

Figure · 원문 PDF 5쪽 · Figure 3: Illustration of Contrastive Calibration Method. Dur-

한 문장 요약

테스트 시점에 MLLM 기반 Reflector의 단계적 추론(Reflection)을 활용해 자기-교사(on-policy) 토큰 수준 증류(R-OPSD)와 대조 보정(Contrastive Calibration)으로 GUI 비주얼 그라운딩 모델을 무감독으로 배포 후 적응시키는 프레임워크를 제안한다.

해결하려는 문제

기존 GUI 그라운딩 모델은 학습 후 파라미터를 고정한 채 배포되어 보지 못한 인터페이스·레이아웃에 적응하지 못한다. 최근의 테스트-타임 RL 계열 방법들은 희소한 스칼라 보상(성공/실패)으로만 적응하여 실패의 원인이나 수정 방향에 대한 정보를 제공하지 못한다. 또한, 자가 생성(prefix) 기반의 auto-regressive 좌표 생성에서 잘못된 접두사(prefix)가 있으면 후속 교사가 제공하는 토큰 수준 감독(signal)이 오염되어 학습을 망칠 수 있다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 본 분석은 제공된 논문 PDF 본문(본문 + Appendix)에 수록된 표, 수치, 알고리즘 설명을 근거로 작성되었다. 표(Table 1,2,3,4,5,6 등)와 본문 문단에서 직접 인용 가능한 수치만 사용했으며, 저자가 명시적으로 밝히지 않은 구현 세부(예: 일부 옵티마이저 세팅의 추가 세부, 데이터 전처리의 모든 파라미터)는 추정하지 않았다. PDF에 포함된 그림·표를 텍스트로 추출한 내용을 바탕으로 요약했으며, 코드·데이터 공개 시 세부 재현성에 대한 추가 확인이 필요하다.