arxiv-wiki

Activation Probes Surface Code-Security Signals that the Model’s Output Misses

← 2026-08-11 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1. Paired win-rate on 147 unseen real-world vulnerabilities:

Figure · 원문 PDF 2쪽 · Figure 1. Paired win-rate on 147 unseen real-world vulnerabilities:

한 문장 요약

오픈웨이트 코드 LLM의 내부 잔차(residual-stream) 활성값에 단일 선형 프로브를 학습시켜, 동일 모델에 같은 질문을 던져 얻는 출력(문자열/로그릿)보다 취약성 신호를 더 잘 복구하는지 실세계 취약점 데이터로 평가했다.

해결하려는 문제

AI가 생성하는 코드 비중이 늘어나 인간 보안검토가 확장하지 못하는 상황에서(또한 널리 쓰이는 코딩 에이전트는 폐쇄중량이라 내부 상태를 읽을 수 없음) 다음 질문을 다룬다: 오픈웨이트 ‘검토자’ 모델의 출력(문장형 YES/NO 또는 체인오브쏘트)을 그대로 묻는 방식이 놓치는 보안 신호를, 그 모델의 활성화에서 읽어낼 수 있는가? 기존 대안(정적 분석기의 높은 오탐률, LLM 프롬프트의 비강건성)은 취약점 탐지에 한계를 보이며 본문은 활성화 기반 프로빙이 이러한 한계를 보완하는지를 실험적으로 묻는다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(제목, 본문, 표, 부록 포함)을 기반으로 작성되었다. 본문에 명시된 수치, 구성(모델 목록, 데이터셋, 레이어·풀링·하이퍼파라미터 탐색 범위), 통계검정 결과 및 표의 숫자를 직접 인용했다. 논문이 참조하는 세부 구현 코드, 훈련 스크립트, 프롬프트의 정확한 예시(몇-shot 예시의 선택 기준) 등은 PDF에 상세 코드로 포함되어 있지 않아 재현을 위해선 원저자 코드나 추가 자료가 필요할 수 있다.