HarnessEval-W: Agentifying the Evaluation of Visual Worlds
- 게시일: 2026-08-18
- arXiv: 2608.16859v1 · PDF
- 저자: Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu
- 분야: cs.CV
- 선정 점수: 6.24
- 선정 이유: 최근성 0.8, 인용 영향 0.0 (인용 0회), 저자 영향 1.5 (최고 h-index 10), AI 주제 적합성 2.6, 개발자 관심 0.7, 학술 신호 0.8, 오픈 웨이트·주요 연구조직 신호 0.0
← 2026-08-18 목록으로 돌아가기
한 문장 요약
세계(visual world) 생성·시뮬레이터를 평가하기 위해 평가 과정을 계층적 에이전트 워크플로로 ‘에이전티파이(agentifying)’하고, 사례별 문맥을 해석해 세분화된 증거 기반 판단(투명한 evidence tree)을 산출하는 실행 가능한 벤치마크 HarnessEval-W를 제안한다.
해결하려는 문제
기존의 월드 모델 벤치마크는 고정된 룰에 따라 지표를 계산하는 정적 파이프라인으로, 생성된 롤아웃의 물리성·인과성·상태 보존성 위반을 인간처럼 식별·검증하는 추론 체인을 자동으로 생성하지 못한다. 이로 인해 점수의 근거를 확인하거나 실패 원인을 계량적·검증 가능하게 추적하기 어렵다. 연구 질문은 ‘평가를 에이전트화하여 사례별 문맥을 해석하고, 평가 질의를 측정 가능한 하위 문제로 분해해 전문화된 서브에이전트를 활용함으로써 투명하고 인간정렬된 월드 모델 평가를 실현할 수 있는가’이다.
핵심 기여
- 에이전트화된 평가 하니스(HarnessEval-W)를 제안하여 사례 문맥 기반 라우팅, 스킬 라이브러리, 서브에이전트 기반의 하위질문 분해·증거 수집·검증·집계를 통해 평가 결과를 투명한 증거 트리로 기록함.
- 월드 모델의 능력을 관찰(Observation Quality), 전이(Transition Correctness), 지속성(World Persistence)의 3개 축과 8개 세부 설정으로 정형화하고, 이에 맞춘 스킬·서브질문 템플릿을 설계함.
- 에이전트 기반 사례 생성 파이프라인(장면 분류기, 이미지 생성기, 이미지-근거 플래너, 케이스 밸리데이터)을 도입해 330개의 검증된 평가 케이스를 자동·반복적으로 생성·검수함.
- 18개 대표 월드 모델(텍스트-투-비디오, 카메라 포즈 기반, 네이티브 액션 기반)을 동일한 330 케이스에서 평가하여 결과를 공개 리더보드로 제시하고, 인간 선호와의 정렬성과 기존 평가(예: WBench) 대비 우수성을 정량적으로 검증함.
- 평가 아키텍처·스킬·사례를 오픈소스로 공개하여 지속적으로 스킬과 케이스를 확장 가능한 ‘라이브(living) benchmark’로 제시함.
접근 방법
- 핵심 아키텍처는 계층적 에이전트 하니스다.
- 전체 절차는 (1) 케이스 입력(초기 이미지, 행동/프롬프트, 평가 의도)을 받아 사례 문맥을 해석해 적절한 상위 스킬을 라우팅하고(케이스별 Skill Routing), (2) 각 상위 스킬은 평가 질문을 측정 가능한 여러 하위질문으로 분해하여 전담 서브에이전트를 소환(sub-agent reasoning), (3) 서브에이전트는 비주얼 루트아웃에서 대상 가시성, 전이 관찰, 최종 상태, 보호 앵커 보존, 추가 이벤트 여부, 물리적 타당성 등 각 항목을 특정 도구(예: 바운딩박스 추적, 프레임 샘플링, 속도 추정 등)와 VLM 기반 시각·언어 추론으로 검사하고 이산 점수와 진단을 반환하며, (4) 상위 에이전트가 서브에이전트의 증거를 검증·집계해 각 축별 점수와 최종 점수를 산출한다.
- 사례 생성 파이프라인은 장면 택소노미(환경, 전경, 중경, 밀도, 외형, 시점)를 샘플링하고 프로브 패밀리(탐색·의도·물리 전이, 드리프트·재방문·오프스크린 진화)를 할당한 뒤, 이미지 생성기→이미지-근거 플래너(행동·카메라 궤적·롤아웃 계획 제작)→케이스 밸리데이터(대상 가시성·실현 가능성·증거 충실성 검증)로 구성된다.
- 모든 서브에이전트는 동일한 VLM 백엔드·온도·프레임 샘플링 설정을 사용해 일관된 근거를 수집한다.
주요 결과
- 벤치마크 구성: 330개의 검증된 평가 케이스(6개 프로브 패밀리), 18개 대표 월드 모델을 동일한 케이스집합으로 평가함.
- 리더보드(예시): Seedance 2.0이 Overall 75.5로 1위(표에 기반한 수치), Wan 2.7이 75.0, Kling 3.0이 74.4 등으로 보고됨(모든 모델은 동일한 330 케이스에서 평가됨).
- 인간 정렬성: Intentional Transition에서 HarnessEval-W의 모델 순위와 인간 Bradley–Terry 순위 간 Spearman ρ = 0.93 (Kendall τ = 0.82), Physical Transition에서 ρ = 0.87 (τ = 0.74)를 달성함.
- 기존 프로토콜 대비 우수성: WBench의 관련 프로토콜(예: Event Edit, Causal Fidelity)과 동일한 비디오·백엔드로 비교한 결과, Physical에서 페어와이즈 정확도(pairwise accuracy)를 31.9% → 71.7%로, 드로우율(draw rate)을 52.2% → 1.8%로 개선했으며, Intentional에서는 정확도 60.2% → 77.8%, 드로우율 36.1% → 11.1%로 개선함(문서화된 수치).
- 평가기 자체의 반복성: 동일 GPT-5.5 백엔드로 3회 반복 실험에서 HarnessEval-W의 선형 피팅 기울기는 9.6–10.8 범위, 인간과의 상관관계는 0.928–0.964 범위로 안정적이며(앙상블 봉투(envelope) 폭 0.33 Bradley–Terry 단위), WBench는 훨씬 큰 변동을 보였음(기울기 11.2→21.0, 상관 0.646–0.780, 봉투 폭 1.61 단위).
한계
- 저자가 명시한 한계 및 향후 과제: 테스트 시점 계산(test-time scaling)이 필요해 더 깊은 서브에이전트 탐색·다단계 검증을 수행하려면 추가 연산이 요구되며 이를 통해 평가 능력을 확장할 필요가 있음.
- 저자가 명시한 한계: 스킬 라이브러리 확대 필요성 — 미래의 더 복잡한 장면과 물리적 정밀도를 다루려면 스킬(검증 절차·도구)의 지속적 확장이 필요함.
- 저자가 명시한 한계: 평가자가 미지분포(오버플로우) 케이스를 만났을 때 스킬 갭을 명시하고 외부 또는 자가 확장 메커니즘으로 스킬을 보완하는 재귀적 자기개선 루프 설계가 필요함.
- 본문에서 합리적으로 확인되는 제약(추정 아님): 현재 파이프라인은 VLM/LLM 백엔드 성능에 의존하며(실험에서 GPT-5.5 및 동일 VLM 설정 활용), 백엔드 품질·설정 변화가 결과에 영향 가능성이 있음(논문은 일부 강건성 실험을 했으나 백엔드 자체가 성능 병목이 될 여지 존재).」「실험적 범위의 제약(추정 아님): 케이스 수(330)와 스킬 세트는 대표성을 갖지만 전 세계의 모든 상호작용·물리·외형 도메인을 포괄하지 못하며, 평가 결과는 선정된 케이스·스킬·모델 집합에 종속됨.
개발자 관점
- 재현: 동일한 330개 케이스와 고정된 VLM/LLM 설정을 사용해 모든 모델에 동일 라우팅을 적용하므로 재현 가능한 비교가 가능하다. 오픈소스 코드·케이스를 통해 실험 재현·확장이 용이하다.
- 구현·아키텍처: 핵심 구성요소는(1) 케이스 문맥 파서(라우터), (2) 스킬 라이브러리(각 스킬의 적용성·증거·검증·집계 규칙 명세), (3) 서브에이전트 템플릿(가시성·전이·최종상태·물리성 검사), (4) 이미지 생성기·플래너·밸리데이터로 구성된 케이스 생성 파이프라인이며, 각 서브에이전트는 시각 도구(프레임 샘플링, 바운딩박스 추적, 속도 추정 등)와 VLM을 결합해야 한다.
- 비용·성능: 평가의 해상도(세부 분해 수준)와 검증 반복 횟수는 테스트 시점 계산 비용에 직접 비례한다. 고정밀·깊은 탐색을 하려면 LLM/VLM 호출 수가 크게 증가하므로 연산·지연·클라우드 API 비용을 설계 단계에서 고려해야 한다.
- 배포·운영: ‘라이브’ 벤치 특징(스킬·케이스 확장)이므로 스킬 버전관리, 스킬 검증 파이프라인, 스킬 호환성 검사, 및 접근 제어(누가 스킬을 추가/수정할지) 정책이 필요하다.
- 안전성·검증: 에비던스 트리(증거 근거)를 자동으로 기록하므로 평가 결정의 감사지원을 제공하고, 인간 심사자 개입이 필요한 케이스(스킬 부재 또는 낮은 판별 신뢰도)를 명시적으로 표시해 휴먼-인-더-루프를 유지할 수 있다.
근거 범위: 본 분석은 사용자로부터 제공된 논문 PDF 본문(페이지 1–17) 텍스트를 기반으로 작성되었다. 주요 정량값(케이스 수 330, 모델 수 18, 인간 정렬 상관계수, WBench 비교 수치, 반복성 수치 등)은 본문에서 직접 인용하였다. 구현의 세부(예: 내부 VLM의 정확한 모델명·하드웨어 비용 수치, 일부 도구의 내부 알고리즘 등)는 본문에 명시되지 않아 추정하지 않았음을 밝힌다.