arxiv-wiki

When Context Gets Root: Privilege Escalation in LLM Harnesses

← 2026-08-30 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Message types in a Codex conversation.

Figure · 원문 PDF 2쪽 · Figure 1: Message types in a Codex conversation.

Figure 2: Automatic Permission Review in Codex.

Figure · 원문 PDF 3쪽 · Figure 2: Automatic Permission Review in Codex.

Figure 3: Delegating a task and presenting it as a user mes-

Figure · 원문 PDF 3쪽 · Figure 3: Delegating a task and presenting it as a user mes-

한 문장 요약

에이전트가 호출마다 생성하는 모델-대면 컨텍스트가 도구(tool) 수준의 악성 콘텐츠를 상위 권한(사용자 또는 시스템 효과적)으로 재표현할 수 있음을 이용해 권한을 상승시키고, 이를 통해 자동 권한검토(또는 작업 수행 단계)까지 우회해 원래 허용되지 않았던 악성 행위를 수행하게 하는 공격(Instruction Privilege Escalation)을 제안·구현하고, 다수의 실제 코딩 에이전트(harness)에서 실험적으로 재현·평가했다.

해결하려는 문제

기존 에이전트 보안은 메시지의 역할(role) 또는 메시지 타입(system/user/tool)에 따라 지시의 권한 수준을 부여하는 ‘instruction hierarchy’에 의존한다. 이 접근은 도구(tool) 출력처럼 낮은 권한의 콘텐츠를 모델이 무조건 따르지 않도록 설계되어 있으나, 실제 실행 중 harness(에이전트 프레임워크)가 모델 호출용 컨텍스트를 재구성할 때 원래 출처(provenance)를 버리고 도구 출력을 사용자나 시스템-효과적(system-effective) 메시지로 ‘재표현’하면(예: 멀티-에이전시 위임, 지속 목표 재주입, 예약 작업, 커스텀 서브에이전트 설치 등) 낮은 권한의 악성 콘텐츠가 상위 권한으로 격상되어 모델과 권한검토기(자동 권한검토, Auto PR)의 결정에 실제로 영향을 미칠 수 있다는 문제를 제기한다. 핵심 연구 질문은 ‘에이전트-측 컨텍스트 재구성이 도구 출처의 악성 내용을 어떻게 상위 권한으로 격상시키며, 이것이 모델·권한검토를 얼마나 신뢰할 수 없게 만드는가’ 이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(제시된 모든 페이지의 텍스트)을 근거로 작성되었음. 본문에 제시된 표(표5, 표6, 표7, 표8, 표9, 표10, 표11, 표12)와 서술적 수치(예: 97.3%, 80.3% 등)를 그대로 인용·요약하였다. 외부 코드, 부록, 실험 스크립트, 또는 저자와의 추가 질의는 참조하지 않았다. 일부 수치(평균 성공률 등)는 논문 요약/도입부와 표의 수치를 함께 종합해 기술했으며, 표에 세부 분포가 있는 경우 그 범위(예: 표10의 65%~100%)로 보완했으므로 세부 구현·환경(특정 모델 파라미터, 랜덤 시드 등)에 따라 변동 가능함을 유의 바람.