arxiv-wiki

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

← 2026-08-09 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: EmoWorld capabilities.

Figure · 원문 PDF 2쪽 · Figure 1: EmoWorld capabilities.

Figure 2: EmoWorld overview. (a) Geometry-preserving neutral and edited panorama pairs yield feature-space VAS vectors

Figure · 원문 PDF 4쪽 · Figure 2: EmoWorld overview. (a) Geometry-preserving neutral and edited panorama pairs yield feature-space VAS vectors

Figure 3: T2V atmosphere comparison across selected affective categories. Prompt-only and Prompt+VAS use identical

Figure · 원문 PDF 6쪽 · Figure 3: T2V atmosphere comparison across selected affective categories. Prompt-only and Prompt+VAS use identical

한 문장 요약

EmoWorld은 기학(geometry)을 보존한 중립·감정 편집 파노라마 쌍에서 추출한 레이어별 특성 방향(feature directions)과 언어-공간 단서를 이용해, 고정된 flow-matching Video DiT를 재학습 없이 조작하여 전역 분위기(atmosphere), 감정표현을 담는 국소적 시맨틱 단서(semantic cues), 그리고 시간적 감정 전개를 분리해 제어하는 프레임워크이다.

해결하려는 문제

기존 텍스트-조건만을 통해 감정 제어를 시도하면 전역 색조·조명(분위기), 장면 내의 감정을 전달하는 국소적 시각 단서(예: 비, 전등, 시든 식물), 그리고 시간적 변화를 한 채널에 억지로 넣게 되어 결과물이 일반적 색 보정에 그치거나(약한 시맨틱 신호), 시간적으로 불연속하거나(급격한 변화) 목표 감정과 정렬되지 않는 문제가 있다. 또한 감정-쌍으로 된 동일한 장면의 비디오 데이터는 희소하고, 비디오 생성기 재학습 없이 감정 제어를 세밀하게 분리·조절하는 방법이 부족했다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트 및 부록)을 근거로 작성되었다. 모든 정량값·설정·하이퍼파라미터·데이터 규모는 본문과 부록에 명시된 수치만을 사용했으며, 구현 세부(예: 소스코드, exact prompt 템플릿 문자열)가 PDF에 포함되지 않아 그런 항목은 재현 지시로만 정리하였다. 본문 외부의 숨겨진 실험 재현 결과나 코드 베이스는 확인하지 못했으므로 실제 구현 시 부록의 매니페스트·프로토콜 파일과 원저자 코드(있다면)를 참조하면 좋겠다.