arxiv-wiki

When Decodability Is Not Enough: Logical Validity Representations, Behavioral Dissociation, and Causal Tests in Language Models

← 2026-09-03 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Layer-wise validity-probe AUROC across normalized transformer depth. Top left: random

Figure · 원문 PDF 7쪽 · Figure 1: Layer-wise validity-probe AUROC across normalized transformer depth. Top left: random

Figure 2: Exhaustive leave-one-out validity-probe generalization. Left: each semantic domain is held

Figure · 원문 PDF 7쪽 · Figure 2: Exhaustive leave-one-out validity-probe generalization. Left: each semantic domain is held

Figure 3: Effect of intervention strength on verification output for Pythia-2.8B, Llama-3.2, and

Figure · 원문 PDF 16쪽 · Figure 3: Effect of intervention strength on verification output for Pythia-2.8B, Llama-3.2, and

한 문장 요약

논리적 검증(주장 타당성 판정) 문제에서 출력 행동과 내부 표현의 불일치를 조사하기 위해 800개(400개 매치 쌍) 예제로 구성된 통제된 데이터셋과 레이어별 선형 프로브·보조 통제·활성화 개입을 사용해 타당성(validity)의 선형적 디코더빌리티, 일반화, 행동적 해석 가능성 및 인과적 영향력을 체계적으로 평가했다.

해결하려는 문제

기존 행동적 평가(정답/오답)만으로는 모델 내부가 주장 타당성(validity)을 어떻게 표현하고 사용하는지를 알기 어렵다. 특히 (1) 모델이 출력으로 타당성을 표현하는지(행동), (2) 숨겨진 상태에서 타당성 관련 정보가 선형적으로 접근 가능한지(표현), (3) 프로브로 찾은 선형 방향이 실제로 모델의 결정에 인과적으로 영향을 미치는지(인과성)를 구별하여 평가할 필요가 있다. 또한 표면문구(템플릿), 의미적 도메인, 추론 패밀리(논리 구조) 등에서 이 표현이 얼마나 일반화되는지도 알려져 있지 않다.

핵심 기여

접근 방법

주요 결과

“인과성 개입” 결과(표 4): α=+4에서 probe 방향 개입의 평균 ∆M 매우 작음(예: Pythia-2.8B −0.0037 [−0.0076,0.0004], Llama-3.2 −0.0022 [−0.0031,−0.0013], Mistral-7B +0.0023 [+0.0011,+0.0034]). 이 개입으로 이진 예측이 바뀐 경우는 거의 없음(α=+4에서 0% 전부, α=−4에서 Llama 한 예제만 플립). 무작위 노름-일치 방향이 동등하거나 더 큰 변화 산출. matched-projection patching도 margin 변화를 거의 유사하게 매우 작게 만듦(≈0.001–0.0045). 이로써 ‘프로브로 찾은 선형 방향이 최종 결정에 강한 인과적 제어변수는 아니다’가 결론임.  

대조 실험: 랜덤 분할에서 TF–IDF(전체 프롬프트) AUROC = 0.970, claim-only TF–IDF = 0.965로 인-분포에서 표면적·어휘적 규칙성이 큰 기여를 함. 템플릿/도메인 이동에서 TF–IDF 성능은 더 크게 하락(예: full-prompt 템플릿 홀드아웃 0.855, 도메인 홀드아웃 0.814)한 반면 히든스테이트 프로브는 대체로 더 강함. 셔플 레이블 프로브(200 perm) null 평균 AUROC ≈ 0.496–0.499(표준편차 ≈0.031–0.039), 관측치가 모두 permuted보다 우수(p≈1/201).

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(및 부록 포함) 내용에 근거해 작성되었다. 표와 수치(예: 표 2–4, 표 8–12, 그림 1–3)는 본문과 부록에서 직접 인용하였다. 구현 세부(예: 정확한 랜덤 시드, 하드웨어/런타임 비용)는 PDF에 명시되지 않아 추정하지 않았고, 모델 내부 체크포인트나 코드 실행 결과는 포함하지 않는다.