arxiv-wiki

On the Threat Model of Weird Generalization and Emergent Misalignment

← 2026-08-25 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Eliciting emergent misalignment or weird

Figure · 원문 PDF 1쪽 · Figure 1: Eliciting emergent misalignment or weird

Figure 2: Rates of weird generalization (top row) and coherency (bottom row) as the quantity of narrow domain

Figure · 원문 PDF 4쪽 · Figure 2: Rates of weird generalization (top row) and coherency (bottom row) as the quantity of narrow domain

Figure 3: Rates of weird generalization (top row) and coherency (bottom row) as the proportion of narrow domain

Figure · 원문 PDF 5쪽 · Figure 3: Rates of weird generalization (top row) and coherency (bottom row) as the proportion of narrow domain

한 문장 요약

작은 도메인 특화 미세조정 데이터의 어떤 속성이 ‘weird generalization’(WG)과 emergent misalignment(EM)을 유발하는지(크기, 구성, 언어, 제시 방식, 사전학습 친숙성, 평가문항 민감도)를 세 모델( Llama‑3.1‑70B, Qwen‑2.5‑32B, Qwen‑2.5‑72B)·네 데이터셋(Birds, Medicine, HP, Sports)에 대해 체계적으로 조작·평가하여 WG가 주로 데이터 구성·언어·사전학습 친숙성에 민감하고 평가문항 선택에도 크게 의존함을 보이며, 따라서 WG/EM은 일상적 미세조정보다 악의적 데이터 엔지니어링에 더 취약한 위협임을 입증한다.

해결하려는 문제

기존 연구는 좁은 도메인 미세조정이 모델 행동을 도메인 밖으로 넓게 변화시키는 WG(특히 EM)를 보고했으나, WG/EM이 발생하기 위해 미세조정 데이터의 어떤 속성이 필요한지(데이터량, 구성 비율, 언어, 제시 방식, 데이터의 사전학습 친숙성 등)를 체계적으로 분석한 연구가 부족했다. 또한 기존 평가는 소수의 정제된 질문 세트에 의존해 측정치가 평가문항에 민감한지 불분명했다. 본문은 이들 질문에 답하고 WG/EM의 위협 모델을 명확히 하고자 한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문 전체(본문, 그림 캡션, Appendix 포함)의 텍스트를 기반으로 작성되었다. 본문에 명시된 수치(데이터셋 크기, 모델명, 특정 실험 수치 등)와 저자 진술을 인용했으며, PDF에서 확인되지 않은 추가 구현 세부사항(예: 내부 툴체인 외의 비공개 설정)은 기술하지 않았다. 부록의 하이퍼파라미터·judge 합의 실험·GPU 시간 등은 PDF에 명시된 내용을 그대로 반영했다.