arxiv-wiki

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

← 2026-08-28 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: CORPORATEBENCH advances the state of the

Figure · 원문 PDF 1쪽 · Figure 1: CORPORATEBENCH advances the state of the

Figure 2: CORPORATEBENCH contains four synthetic companies spanning different industries, headcounts, and

Figure · 원문 PDF 3쪽 · Figure 2: CORPORATEBENCH contains four synthetic companies spanning different industries, headcounts, and

Figure 3: An email generated for CORPORATEBENCH.

Figure · 원문 PDF 4쪽 · Figure 3: An email generated for CORPORATEBENCH.

한 문장 요약

기업 환경을 모사한 시계열 지식베이스에서 문서를 합성·샘플링해 기업 규모(최대 232k 문서)에 근접한 대규모 멀티문서 Q&A·추출 벤치마크(CORPORATEBENCH)를 만들고, 여러 LLM에 대해 RAG와 KB 접근에서 정보추출·질의응답 성능을 비교·분석하였다.

해결하려는 문제

실제 기업 내부 통신 데이터는 비공개여서 대규모·논리적 일관성을 가진 평가 데이터가 부족하고, 기존 합성 벤치마크는 지나치게 단순하거나 문서 수가 기업 규모를 반영하지 못함. 이에 따라 LLM의 대규모 멀티문서(시계열 포함) 추론·검색 성능을 현실적 조건에서 측정할 수 있는 평가셋이 필요하다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 요청하신 논문 PDF 본문(제공된 페이지 텍스트)을 근거로 작성했습니다. 본문과 표(Table 1, 3, 4, 12, 13 등) 및 부록(appendix)에서 직접 인용·요약했습니다. 일부 구현·실험 세부(예: 부록에만 상세 기재된 프롬프트와 ETL 소스코드)는 본문에 요약되어 있으므로 부록을 함께 확인하면 더 완전한 재현이 가능합니다. 본문에 명시되지 않은 수치·세부사항은 생성하지 않았습니다.