MASS: Multiplayer World Models with Authoritative Shared State
- 게시일: 2026-08-09
- arXiv: 2608.06257v1 · PDF
- 저자: Ziqi Cai, Siqi Yang, Yimu Wang, Zixian Gao, Yunheng Liu, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi
- 분야: cs.CV, cs.HC
- 선정 점수: 3.28
- 선정 이유: 최근성 0.5, 인용 영향 0.0 (인용 0회), 저자 영향 0.0 (최고 h-index 0), AI 주제 적합성 1.8, 개발자 관심 0.5, 학술 신호 0.6, 오픈 웨이트·주요 연구조직 신호 0.0
← 2026-08-09 목록으로 돌아가기
한 문장 요약
MASS는 게임 서버의 권위적 상태 개념을 학습 기반 세계 모델로 도입해 ‘타입화된(authoritative) 전역 상태’를 논리 전이(Logic Engine)와 카메라-조건 렌더러(Rendering Engine)로 분리하여 다중 동시 시점에서 일관되고 확장 가능한 멀티플레이어 시뮬레이션을 가능하게 한다.
해결하려는 문제
기존 비디오/비주얼-잠재 기반 세계 모델은 재현적 메모리(visual latent 또는 영상 히스토리)에 세계 상태와 시점 의존적 외형 정보를 섞어 보관한다. 멀티플레이어 환경에서는 각 클라이언트(또는 뷰)마다 중복된 반복 상태를 유지하게 되어 계산 비용이 플레이어 수에 비례로 증가하고, 동시 뷰 간 불일치(view inconsistency)가 발생하며, 엔터티 정체성·위치 보존과 같은 구조적 회복성이 저하된다. 논문은 이러한 한계를 해결하고 ‘하나의 권위적 전역 상태’에서 모든 클라이언트 뷰를 생성하는 학습적 아키텍처 설계를 제시한다.
핵심 기여
- 학습된 권위적(typed) 전역 상태를 재현 변수로 삼고 이를 단일 동시 동작(transition)의 출력으로 예측한 뒤 카메라-조건 렌더러에서 필요시 뷰를 생성하는 ‘논리(Logic) + 렌더링(Rendering)’ 분리 설계를 제안함.
- 스키마 기반 토크나이저와 고정 폭(고정 레이아웃) 직렬화를 사용해 각 엔터티 레코드를 typed token sequence로 표현하고, 레코드 단위로 병렬 배치하여 확장성(1,024 엔터티 규모)을 확보한 기록적 구현을 제시함.
- decoder-only Transformer(Logic Engine)로 규정된 표준화된 모델 인터페이스를 사용해 스키마-도출 마스크와 결정적 선택자(det. selector)로 구조적 제약(정렬성, 유일성 등)을 보장하면서 전역 상태 전이를 학습적으로 수행함.
- 공식화·벤치마크와 광범위 실험을 통해(매치드 멀티플레이어 Snake, 8개 게임 렌더링, population-scale 1,024 엔터티 · 10,000 step 등) 상태 복원성(state recovery), 뷰 간 불일치(X-view), 퍼셉추얼 품질과 렌더러 성능을 분리해 평가하는 프로토콜(SRSC 포함)을 제시하고 비교 우위를 보임.
접근 방법
- 핵심 아이디어는 ‘권위적 타입화 상태(typed state)’를 재발생(recurrent) 메모리로 두고, 그 상태를 전진시키는 Logic Engine과 상태로부터 카메라별 프레임을 합성하는 Rendering Engine을 분리하는 것이다.
- 구체적 구성은 다음과 같다.
-
- 스키마 및 World State Tokenizer: 게임별 스키마 Σg(엔터티 종류, 필드, 인스턴스 수)를 선언하고, 각 틱에서 스키마에 정의된 Kg개의 레코드 ρi_t를 canonical serialization으로 고정 폭 토큰 시퀀스 ui_t로 변환한다.
- 각 레코드는 주변 컨텍스트 ci_t(스키마 정의의 이웃 윈도우), 소유자 행동 aπ(i)_t, 해당 레코드 관련 난수 ei_t 등을 포함한다.
-
- Logic Engine: decoder-only Transformer(폭 256, 6층, 8헤드, 토큰-임베딩 공유)를 사용해 레코드별로 autoregressive하게 다음 레코드 토큰 yi,j_{t+1}를 예측한다.
- 자기-어텐션은 각 레코드 내부로 국한되고 레코드 간 상호작용은 현재 상태에서 미리 계산한 이웃 창(ci_t)으로 주입한다.
- 스키마 유도 마스크와 결정적 선택자가 필드 도메인·정렬·유일성 등을 강제하여 구조적 유효성을 보장한다.
- 예측된 레코드들은 조립(AΣg)되어 ˆs_{t+1}이 되고 이 값이 다음 반복의 단일 권위 상태가 된다.
-
- Rendering Engine: 권위적 상태를 카메라-로컬 프로젝션 Pi(ˆs_t)로 rasterize(occupancy, 소유자, 깊이 등 16채널 텐서)한 뒤, residual U-Net(스탬프 64채널, 다운/업샘플 단계, 병렬 잔차블록)으로 RGB 프레임 ˆo^i_t을 생성한다.
- 렌더러는 predicted state와 카메라 파라미터 κ_i만을 입력으로 사용하며, 여러 카메라는 동일한 예측 상태를 공유한다.
-
- 서버/클라이언트 논리: 서버는 매 틱 Logic Engine으로 ˆs_{t+1}을 예측·버전화해 배포한다.
- 렌더링은 클라이언트에서 각자 수행(요청 뷰 수에 따라 비용 증가).
- 업데이트 단절(stall) 시 클라이언트는 받은 최신 권위 상태로 동일한 Logic Engine을 돌려 로컬 예측을 수행(자기 행동만 제공, 타 플레이어는 no-op)해 응답성을 유지한다.
-
- 학습/추론 세팅: Logic Engine은 AdamW(lr=2e-4, wd=1e-4), batch=8, 20k one-step teacher-forced 업데이트(매치드 논문 실험 기준)를 사용하고, 추론 시는 그리디 디코딩으로 토큰을 예측해 autoregressive하게 상태를 합성함.
주요 결과
- 매치드 멀티플레이어 Snake(128×128, 128 ticks, 2-view 동기 테스트)에서 MASS는 LPIPS 0.098, Parser(상태 복원) 0.764, Count 0.234, Position 0.355, Event F1 0.552, X-view(뷰 간 불일치) 0.000, Invalid 0.177을 기록해(표 2) 대부분 지표에서 최상위를 차지함. 비교 대상: MultiWorld LPIPS 0.277, Parser 0.067; B-PV Parser 0.128; B-UN LPIPS 0.123 but Parser 0.000.
- 타입화된 상태의 직접(로직만) 평가에서 매치드 Snake의 Typed-token Transformer는 H=1에서 Semantic 97.9%, Active 94.9%, Head-position 99.1%, Full exact 41.7%, Contradiction 0.0(표 B.2). 반면(동일 데이터·예산 조건의) 밀집/영상 기반 대안들은 위치 정확도(head-position)가 거의 0% 수준이고 구조적 모순(contradiction) 비율이 높았음.
- 크로스-게임 및 렌더링: 8개 게임(예: Snake, Crate Pusher, Pac-Man, Tron 등)에서 렌더러의 held-out reconstruction 품질(Table 3): Snake PSNR 38.82 dB / Object PSNR 29.44 / SSIM 0.996; 다른 게임들도 PSNR 범위 약 23.72–40.24 dB, 대부분 SSIM>0.97을 보임.
- 대규모·장기 안정성: 동일 아키텍처로 1,024 동시 플레이어 엔티티를 10,000 recurrent ticks까지 예측 가능함을 보고함(본문). 또한 장기 무참조(stress) 실험에서 H=4096까지 구조적 무결성(invalid=0)과 로스터 보존을 보고함(부록 C).
- 클라이언트 예측(업데이트 누락) 실험(Table 4): 서버 입력을 전부 아는 ‘oracle joint inputs’ 조건에서는 in-view agreement가 k=1..8에서 모두 1.000 유지. 클라이언트가 자기 행동만 알고 타 플레이어를 no-op로 처리하는 조건에서는 in-view agreement가 k=1:0.815, k=2:0.652, k=4:0.604, k=8:0.429로 감쇠하나 자신의 아바타(head) 위치 오차는 모든 k에서 0.00(즉 로컬 아바타는 변위 없음).
한계
- 저자 명시: 본 설계를 3D 환경과 더 풍부한 엔터티 상호작용으로 확장하는 것이 자연스러운 향후 과제이며(결론), 현재 실험은 주로 2D/격자형 아케이드류 게임들(예: Snake, Pac-Man, Crate Pusher 등)에 적용되어 있음.
- 본문에서 확인되는 제약/한계(확인 기반): (1) 게임별로 토크나이저·임베딩·모델 가중치를 별도로 학습해야 하므로(스키마는 선언적이지만) 완전한 ‘범용 단일 모델’은 아님. (2) Logic Engine의 단일 스텝 처리 지연은 매치드 모델에서 45.55 ms(표 B.4)로 보고되어 있어 실시간 고주사율(예: 60Hz)에 배치하려면 최적화 또는 더 경량화가 필요함. (3) 렌더러 비용은 요청된 뷰 수에 따라 선형 증가; H100에서 렌더러 전체 비용이 1뷰 189.6 ms → 1024뷰 842.4 ms(학습 CNN 부분 4.4→379.7 ms)로 측정되어, 대규모 배포시 서버-클라이언트 분산 정책과 렌더링 인프라가 필요함. (4) SRSC(비전-언어 판정)를 Qwen3.5-27B로 사용해 의미적 정합을 판정했지만, VLM 기반 판단은 모델·프롬프트 선택에 민감할 수 있음(부록 D).
개발자 관점
- 권위적 전역 상태(schema-defined typed records)를 도입하면 다중 동시 뷰의 일관성(X-view)을 아키텍처 수준에서 보장할 수 있으므로 멀티뷰 환경에서는 시각적 잠재를 재발생 변수로 쓰는 방식보다 구조적 이점이 큼.
- 스키마(엔티티 종류·필드·카운트)와 canonical serialization을 명시적으로 설계해야 하며, 필드별 마스크와 결정적 선택자(정렬·유일성)를 통해 구조적 무결성을 학습 외적(아키텍처 차원)으로 보장하면 학습 부담을 줄일 수 있음.
- 확장성 구현 팁: 레코드 단위로 자기-어텐션을 국한하고 레코드 배치 처리를 통해 대규모 엔티티(본문 실험: 5,121 레코드=1,024 snakes+4,096 food buckets)를 처리할 수 있음. 이 방식은 전이 연산을 엔티티 수에 선형적으로 증폭시키지 않고 배치 처리로 완화 가능.
- 배포/운영 시 주의: 서버는 Logic Engine으로 세계를 한 번만 전진시키고 버전화된 상태를 여러 클라이언트에 배포하는 모델이므로, 서버 측 전이 비용은 뷰 수와 무관하지만 상태 배포(네트워크) 비용은 클라이언트 수에 선형 증대함(tsync(S)). 렌더링은 클라이언트에서 수행하거나(분산), 서버에서 중앙화해 스트리밍하는 등 아키텍처 선택이 중요함.
- 재현 요구사항: 재현하려면 (1) 스키마 파일과 canonical tokenizer/serializer, (2) 기록된 joint-actions·exogenous tokens·카메라 궤적, (3) Logic Engine 및 Rendering Engine 학습 하이퍼파라미터(예: AdamW lr=2e-4, batch=8, 20k 업데이트), (4) 결정적 마스크/선택자 규칙이 필요함. 논문은 구현 세부(예: Transformer 폭·층수·헤드, 렌더러 구조, TSUBAME4.0 사용)를 부록에 기술해 재현에 도움을 줌.
근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트 및 부록)을 근거로 작성했다. 수치(표의 값, 하이퍼파라미터, 아키텍처 설정)는 본문과 부록에 명시된 값만 사용했으며, PDF에 직접 표기되지 않았거나 저자가 명시적으로 제공하지 않은 구현·하드웨어 최적화 세부사항은 포함하지 않았다.