arxiv-wiki

CivBench: A Long-Horizon Benchmark for Tool-Mediated Agents in Civilization VI

← 2026-09-03 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Model Context Protocol (MCP) architecture. Agents interact via MCP tools; the server

Figure · 원문 PDF 3쪽 · Figure 1: Model Context Protocol (MCP) architecture. Agents interact via MCP tools; the server

Figure 2: Tool call composition over 10-turn rolling average. Tool budgets are dominated by local

Figure · 원문 PDF 6쪽 · Figure 2: Tool call composition over 10-turn rolling average. Tool budgets are dominated by local

Figure 3: Descriptive Proactive Monitoring Rate by model (A) and subcategory (B). Strategic

Figure · 원문 PDF 7쪽 · Figure 3: Descriptive Proactive Monitoring Rate by model (A) and subcategory (B). Strategic

한 문장 요약

CivBench는 Model Context Protocol(MCP)와 내레이션 레이어를 통해 장기(300+턴), 도구 호출이 많은 환경에서 언어모델 에이전트의 주의 할당(정보 조회)과 계획 실행을 추적·정량화하기 위한 오픈소스 벤치마크이다.

해결하려는 문제

기존 평가들은 추론, 단기 계획, 혹은 도구 사용을 분리해서 측정하는 경향이 있어 장기간의 도구 매개 상호작용(부분 관찰, 대규모 행동 공간, 수백 턴에 걸친 의사결정)에서 에이전트가 관련 상태를 유지하고 진술한 계획을 실제 행동으로 옮기는지를 직접 관찰·측정하기 어렵다. CivBench는 ‘정보가 사용 가능한가’와 ‘정보가 문맥으로 불러와졌는가’를 분리해 도구 호출 로그에서 주의 할당과 계획 실행 충실도를 측정하는 것을 연구 문제로 삼는다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문 전체에서 직접 인용·요약한 내용에 기반한다. 모든 정량 값(예: PMR 비율, RAG@10 범위, 통계검정 결과, 샘플 크기, 비용·시간 견적, Table·Figure 수치 등)은 본문·표·그림에서 보고된 수치를 그대로 옮겼다. 본문에 명시되지 않은 구현 세부(예: 내부 하이퍼파라미터, LLM 호출 파라미터의 세부 설정)는 생성하지 않았으며, 라벨링 편향 가능성 등은 본문 근거에 따라 ‘합리적 추정’으로 구분해 기술했다.