arxiv-wiki

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

← 2026-08-15 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: PlayWorld evaluates world models from the perspective of a human player. We define

Figure · 원문 PDF 1쪽 · Figure 1: PlayWorld evaluates world models from the perspective of a human player. We define

Figure 2: Benchmark construction pipeline of PlayWorld. Starting from diverse initial worlds,

Figure · 원문 PDF 5쪽 · Figure 2: Benchmark construction pipeline of PlayWorld. Starting from diverse initial worlds,

Figure 3: Composition of PlayWorld. The benchmark comprises over 170 human-annotated cases

Figure · 원문 PDF 5쪽 · Figure 3: Composition of PlayWorld. The benchmark comprises over 170 human-annotated cases

한 문장 요약

사람 플레이어처럼 장기 목표를 주고 멀티모달 Agent Player가 다양한 세계 모델과 상호작용하며 기하 일관성·상호작용 충실도·가려진 상태 진화·통찰(관찰) 진화를 VQA 루브릭과 자동 지표로 평가하는 장기 상호작용형 세계모델 벤치마크 PlayWorld를 제시한다.

해결하려는 문제

기존 세계모델 평가들은 주로 사전정의된 저수준 동작(고정된 액션 시퀀스 또는 카메라 궤적)에 따라 비교를 수행한다. 그러나 서로 다른 모델은 액션 그레인(동작 크기·지속시간)과 반응 속도가 달라 동일한 제어가 모델간에 상이한 시각적 결과를 만들고, 인간 플레이어가 추구하는 ‘장기 목표’(예: 360° 회전 후 재방문, 물속으로 들어갔을 때 물리적 반응 관찰)를 공정하게 비교할 수 없다. 또한 웹 기반 폐쇄형 모델들은 수동 인간 평가에 의존해 노동집약적이며 편향에 취약하다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(주요 본문과 부록/표/그림)을 기반으로 작성되었다. 구현 세부 파라미터의 일부(예: 보충 자료의 상세 설정, 모델별 내부 하이퍼파라미터)는 보충자료에 추가로 기재되어 있을 수 있으며 본문에 명시된 정보만을 근거로 기술하였다. VQA/에이전트 관련 일부 실험적 환경(네트워크·인프라)에 따른 지연 값은 본문 표에 보고된 범위로 제시했으며, 배포 환경에 따라 변동할 수 있다.