arxiv-wiki

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

← 2026-08-12 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Alignment and scale both confer off-path robustness; the alignment effect is task-specific. Conditional

Figure · 원문 PDF 7쪽 · Figure 1: Alignment and scale both confer off-path robustness; the alignment effect is task-specific. Conditional

Figure 2: Off-path reasoning resilience across model families and benchmarks (representative checkpoints,

Figure · 원문 PDF 13쪽 · Figure 2: Off-path reasoning resilience across model families and benchmarks (representative checkpoints,

Figure 3: Off-path robustness across the full size ladder. Absolute accuracy vs. taboo dose (baseline, then

Figure · 원문 PDF 14쪽 · Figure 3: Off-path robustness across the full size ladder. Absolute accuracy vs. taboo dose (baseline, then

한 문장 요약

입력 프롬프트를 변경하지 않고 디코딩 단계의 로짓을 런타임에 조작(상위 후보 토큰을 단어 시작 부분에서 마스킹)하여 모델을 주된 생성 경로에서 강제로 벗어나게 하고, 이를 통해 대형 언어모델(LLM)의 ‘오프-패스’ 추론 강인성(robustness)을 진단하는 Decoding-Level Taboo 기법과 정량화 지표(Injected Surprisal)를 제안한다.

해결하려는 문제

기존 LLM 평가들은 주로 명목(nominal) 조건에서의 정답 생성 능력에만 초점을 맞추어 모델이 최적화된 좁은 생성 경로를 잘 따라가는지를 평가한다. 실제 배포 환경에서는 복잡한 시스템 프롬프트, 안전 가드레일, 구조적 출력 제약 등이 모델을 지속적으로 명목 경로에서 벗어나게 하며, 프롬프트 수준에서의 음성 제약(negative constraints)은 규칙 준수 실패가 내적 추론 붕괴인지 단순한 지시 불이행인지 구분하지 못한다. 따라서 프롬프트 변경을 배제한 채 런타임에서 직접 디코딩 단계의 로짓에 개입하여 모델의 오프-패스(강제 우회) 추론 내구성을 진단할 방법이 필요하다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문 및 부록 포함)의 텍스트를 근거로 작성되었음. 본문에 명시된 주요 수치(예: retention 비율, 스케일별 수치, 평균 생성 토큰 증가, 실행 시간)는 PDF 내 표기와 그림·본문 설명에서 직접 추출했으며, 코드 리포지토리나 외부 메타데이터는 접근하지 않았음. 부가적인 구체적 구현 파라미터(예: 내부 라이브러리 세부 옵션)나 재현 시의 하드웨어 환경 차이에 따른 미세한 값 변동은 PDF에 명시된 범위를 벗어나 판단하지 않았음을 밝힌다.