arxiv-wiki

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

← 2026-08-18 목록으로 돌아가기

한 문장 요약

세계(visual world) 생성·시뮬레이터를 평가하기 위해 평가 과정을 계층적 에이전트 워크플로로 ‘에이전티파이(agentifying)’하고, 사례별 문맥을 해석해 세분화된 증거 기반 판단(투명한 evidence tree)을 산출하는 실행 가능한 벤치마크 HarnessEval-W를 제안한다.

해결하려는 문제

기존의 월드 모델 벤치마크는 고정된 룰에 따라 지표를 계산하는 정적 파이프라인으로, 생성된 롤아웃의 물리성·인과성·상태 보존성 위반을 인간처럼 식별·검증하는 추론 체인을 자동으로 생성하지 못한다. 이로 인해 점수의 근거를 확인하거나 실패 원인을 계량적·검증 가능하게 추적하기 어렵다. 연구 질문은 ‘평가를 에이전트화하여 사례별 문맥을 해석하고, 평가 질의를 측정 가능한 하위 문제로 분해해 전문화된 서브에이전트를 활용함으로써 투명하고 인간정렬된 월드 모델 평가를 실현할 수 있는가’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 본 분석은 사용자로부터 제공된 논문 PDF 본문(페이지 1–17) 텍스트를 기반으로 작성되었다. 주요 정량값(케이스 수 330, 모델 수 18, 인간 정렬 상관계수, WBench 비교 수치, 반복성 수치 등)은 본문에서 직접 인용하였다. 구현의 세부(예: 내부 VLM의 정확한 모델명·하드웨어 비용 수치, 일부 도구의 내부 알고리즘 등)는 본문에 명시되지 않아 추정하지 않았음을 밝힌다.