arxiv-wiki

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

← 2026-08-18 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Counterfactual investigation of one in-the-wild behavior, as produced by the CHIVE

Figure · 원문 PDF 2쪽 · Figure 1: Counterfactual investigation of one in-the-wild behavior, as produced by the CHIVE

Figure 2: Four hand-selected diverse behaviors discovered and explained by the pipeline, from

Figure · 원문 PDF 3쪽 · Figure 2: Four hand-selected diverse behaviors discovered and explained by the pipeline, from

Figure 3: Each investigation yields two data types, shown here for the investigation of Figure 1,

Figure · 원문 PDF 4쪽 · Figure 3: Each investigation yields two data types, shown here for the investigation of Figure 1,

한 문장 요약

실제(“in the wild”) 대화·프롬프트에서 모델의 예상치 못한 행동을 자동으로 찾아내고, 프롬프트 편집(카운터팩추얼)으로 검증 가능한 원인 주장과 레이블을 생성하는 CHIVE 파이프라인을 제안하고 이를 이용해(1) 기존 활성화 기반 해석 도구들의 유용성을 counterfactual simulatability 관점에서 평가하고, (2) 생성된 데이터로 모델을 학습하여 자기 행동 예측(및 일반화)을 검증했다.

해결하려는 문제

기존 LLM 행동 설명 연구들은 ‘좋은 설명’이란 무엇인지, 그리고 설명이 실제로 모델 행동의 원인을 예측하는 데 얼마나 도움이 되는지를 명확히 평가하기 어렵다. 특히 실제 사용자 대화 등 자연스러운 입력 분포(‘in the wild’)에서 다양한 행동과 그에 대한 원인 가설을 대규모로 얻고, 이를 검증 가능한 방식(카운터팩추얼 실험)으로 라벨링하는 방법이 부족하다. 또한 활성화(activation) 기반 해석 도구들이 좁은 파인튜닝 기반 감사(auditing) 설정에서는 유용함을 보였으나, 자연 발생 행동에 대해 동일한 유용성을 제공하는지 불명확하다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트 및 부록)을 근거로 작성되었음. 본문과 부록의 표·수치(예: 데이터셋 크기, 비용, AUROC 값 등)는 PDF에서 직접 추출한 값만 사용했으며, 그림의 정확한 수치값이나 일부 그래프 수치(텍스트로 명시되지 않은 소수점 등)는 본문 설명 또는 표에 명시된 범위로 대체해 기술함. 논문에 제시된 추가 세부 구현(코드 수준의 하이퍼파라미터 튜닝 등)이나 외부 링크의 최신 상태는 본 분석에 포함되지 않았음을 밝힘.