arxiv-wiki

EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards

← 2026-08-25 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Coverage and model landscape. Task and answer-unit coverage across hazards and capabilities (left); mean

Figure · 원문 PDF 1쪽 · Figure 1: Coverage and model landscape. Task and answer-unit coverage across hazards and capabilities (left); mean

Figure 2: Benchmark overview. Global event coverage and four representative investigations. Each case follows a

Figure · 원문 PDF 3쪽 · Figure 2: Benchmark overview. Global event coverage and four representative investigations. Each case follows a

Figure 3: Expert roles and scientific tools for investi-

Figure · 원문 PDF 4쪽 · Figure 3: Expert roles and scientific tools for investi-

한 문장 요약

지구 시스템 재해 패키지(다중 출처 자료)를 열람·선택·계산·증거 연계·출처 보존하는 과정을 평가하는 실행 가능하고 재현 가능한 과학 에이전트 벤치마크를 제안하고, 25개 시스템을 통제된 도구 사용 프로토콜로 평가해 증거 지역화와 증거–주장 결속의 실패가 신뢰성 병목임을 규명한다.

해결하려는 문제

기존 지구과학·재난 분석 벤치마크는 분석에 필요한 관측·데이터를 사전에 고정하여 제공하는 경우가 많아, ‘어떤 증거를 선택하고 어떻게 서로 정렬하여 계산과 물리적 해석까지 일관되게 유지하는지’라는 실제 연구 흐름을 평가하지 못한다. 이로 인해 모델이 개별 계산이나 해석은 잘해도 다중 출처 증거를 구성·대조·보존해 최종 결론까지 일관되게 도달하는 능력(신뢰성)을 측정하기 어렵다. 연구 질문(RQ)은 (1) 현재 시스템이 감시 가능한 다중-출처 재난 조사를 완수할 수 있는가, 평균 성능과 신뢰성(완전성) 격차의 원인은 무엇인가, (2) 언제 추론이 조사 성능을 개선하는가(증거 접근·도구·메모리·중단·실행 제어의 역할), (3) 관측이 이미 주어졌을 때의 해석 성능과 증거를 스스로 구성·유지하는 성능의 차이는 어느 정도인가이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문과 부록 일부 텍스트)을 기반으로 작성되었음. 표·수치(예: 405개 과제, 199개 사건, 10,879 정답 단위, mean unit accuracy 및 Strict@95 수치, 오라클 실험 결과 등)는 본문에서 직접 인용했다. PDF에서 완전한 부록(예: 전체 시스템 목록, 상세 하이퍼파라미터, 비용 산정 세부내역)이나 일부 표·그림 원문을 자동으로 추출하지 못한 부분이 있을 수 있으므로, 구현 복제나 추가 수치 확인이 필요하면 원문 PDF의 해당 부록과 공개 저장소(저자 제공 GitHub/Hugging Face)를 참조하기 바람.