arxiv-wiki

How Language Models Organize and Structure Moral Knowledge

← 2026-08-28 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Pairwise cosine similarity between foundation probe directions at layer 7 (bootstrap-stable; all six

Figure · 원문 PDF 8쪽 · Figure 1: Pairwise cosine similarity between foundation probe directions at layer 7 (bootstrap-stable; all six

Figure 2: Layer-wise geometric metrics for OLMo-2 1B. (a) Mean pairwise cosine similarity is relatively flat

Figure · 원문 PDF 9쪽 · Figure 2: Layer-wise geometric metrics for OLMo-2 1B. (a) Mean pairwise cosine similarity is relatively flat

Figure 3: Hierarchical clustering (Ward’s method) of foundation probe directions at layer 7 (bootstrap-stable),

Figure · 원문 PDF 10쪽 · Figure 3: Hierarchical clustering (Ward’s method) of foundation probe directions at layer 7 (bootstrap-stable),

한 문장 요약

MFT의 여섯 도덕적 토픽마다 독립 선형 프로브를 학습해 그들의 가중치 방향을 표현공간에서 비교·분석하여, 대형 언어모델들이 도덕 지식을 구별하면서도 공유된 도덕 성분을 갖는 ‘통합(integration)’ 기하를 형성함을 보인다.

해결하려는 문제

기존 연구는 모델이 ‘도덕적 내용 유무’를 감지할 수 있음을 보였으나(이진 탐지), 이것은 낮은 기준이다. 진정한 ‘도덕 이해’는 care, fairness, loyalty 등 서로 다른 도덕적 토대를 구별하고 이들 사이 관계를 표현공간에서 구조화하는 것이다. 본 논문은 대형 언어모델이 단순 검출을 넘어서서 토대별로 구별되는 방향을 형성하고, 그들 사이의 기하학적 관계(붕괴·격리·통합 중 어느 양상)를 학습하는지를 규명한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 요청자가 제공한 논문 PDF 본문 전체(본문·표·부록 포함)의 텍스트를 기반으로 작성되었다. 수치는 PDF에 명시된 값만 사용했으며(예: 평균 쌍별 코사인, 부분성 점수, 부트스트랩 CI, σ* 등), 저자가 명시적으로 언급하지 않은 추가 실험·하이퍼파라미터나 외삽 수치는 만들지 않았다. 부트스트랩·퍼뮤테이션·데이터셋 상세(예: 240-pair 구성, 32/8 split, 딜레마 300개)는 본문·부록에서 직접 확인 가능한 항목이다. 인과성 관련 예비 실험은 본문에서 ‘예비’·’비통제’로 기술되어 있어 해당 부분은 설명 그대로 표시했다. 추가 검증(예: 감정성 대조 배터리, 다른 코퍼스 모델)은 본문에 수행되지 않아 본 분석에서도 미실시로 기재했다.