arxiv-wiki

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

← 2026-08-31 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1. Source evidence exhibiting factual disagreement and the corresponding matched question pair (named-entity

Figure · 원문 PDF 2쪽 · Figure 1. Source evidence exhibiting factual disagreement and the corresponding matched question pair (named-entity

Figure 2. Overview of ElephantBench as a systematic probe of parametric memory in LLMs. (a) Verified conflicts from

Figure · 원문 PDF 3쪽 · Figure 2. Overview of ElephantBench as a systematic probe of parametric memory in LLMs. (a) Verified conflicts from

Figure 3. Distribution of the 1,094 benchmark questions

Figure · 원문 PDF 6쪽 · Figure 3. Distribution of the 1,094 benchmark questions

한 문장 요약

장기 꼬리(low-exposure) 웹 문서에서 자연 발생하는 출처 간 불일치를 그래프 기반 파이프라인으로 추출해 1,094개의 폐쇄형(closed-book) 다중정답 QA 벤치마크(ElephantBench)를 만들고, 32개 LLM이 동일 사실의 서로 다른 검증된 진술(계정)을 파라메트릭 메모리에서 얼마나 완전하게 회상하는지(‘epistemic myopia’)를 진단했다.

해결하려는 문제

기존 사실 질의응답 평가는 보통 단일 정답을 전제로 해 LLM이 장기 꼬리(long-tail) 사실에 대해 서로 다른(출처별로 검증된) 진술들을 공존시켜 기억하는지를 평가하지 못한다. 또한 지식 충돌 관련 벤치들은 대부분 오픈북 설정(증거 제공)으로, 파라메트릭 메모리가 서로 다른 계정을 독립적으로 보유하는지의 폐쇄형 검증을 제공하지 않는다. 따라서 연구 질문은 ‘LLM이 저노출 문서들에 기반한 장기 꼬리 사실을 파라메트릭 메모리에서 얼마나 완전하게(모든 검증된 계정을) 회상하는가’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(전체)에 기반해 작성되었으며 주요 수치와 방법·실험 결과는 본문 표·도표·부록에서 직접 추출했습니다. 저자가 명시적으로 공개하지 않은 항목(예: 개별 모델의 내부 사전학습 코퍼스, 상세 인프라 사용 시간)은 문헌에서 확인 불가하여 만들지 않았습니다. 본문 외부의 후속 작업이나 모델 업데이트(논문 발표 이후 공개된 모델)는 반영되어 있지 않습니다.