arxiv-wiki

Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models

← 2026-08-11 목록으로 돌아가기

한 문장 요약

자연어 질의를 받아 인간과 유사한 다중 라운드 탐색을 통해 소수 샘플만으로 시각 생성모델을 효율적·설명가능하게 평가하는 Evaluation Agent 프레임워크와, 이를 역사-조건부 CoT 기록(EA-CoT-10K)으로 학습한 소형 로컬 플래너(EA-3B / Open-EA)를 제안한다.

해결하려는 문제

기존 시각 생성 모델 평가 방식은 수백~수천 샘플을 필요로 해 계산 비용과 시간이 크고(특히 확산 기반 샘플링에서), 고정된 프롬프트·파이프라인에 기반해 사용자별 요구를 반영하지 못하며 단일 수치(예: FID/FVD)로만 결과를 제공해 해석성이 낮다. 또한 고정 시험집합은 동적·개별화된 실패 모드를 탐지하거나 적응적 증거 수집 전략을 취하기 어렵다. 본 연구는 소수 샘플로 빠르게 모델 전반 능력을 추정하고, 열린-엔디드 사용자질의에 대응하며 증거 기반으로 평가 경로를 동적으로 갱신하는 방법을 묻는다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–12)에 기반한 내용 요약 및 수치·설명 추출이다. 표·그림·수치(예: Table 2–6, Fig.1–5), EA-CoT-10K 및 학습 하이퍼파라미터 등은 본문에서 직접 확인했다. 외부 저장소 코드·모델의 실제 상태나 추가 실험 로그는 확인하지 않았으며, 논문 텍스트에 명시되지 않은 세부 구현·하드웨어 비용(예: 정확한 GPU 종류, API 요금)은 기술하지 않았다.