arxiv-wiki

SHE: Trajectory-driven Safety Harness Evolution for LLM Agents

← 2026-08-12 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Motivation of Safety Harness Evolution (SHE). SHE decouples the safety harness into editable

Figure · 원문 PDF 2쪽 · Figure 1: Motivation of Safety Harness Evolution (SHE). SHE decouples the safety harness into editable

Figure 2: Overview of Safety Harness Evolution (SHE). SHE decomposes the safety harness into four

Figure · 원문 PDF 4쪽 · Figure 2: Overview of Safety Harness Evolution (SHE). SHE decomposes the safety harness into four

Figure 3: Transfer of evolved harness updates across different agent models. The harness evolved on

Figure · 원문 PDF 7쪽 · Figure 3: Transfer of evolved harness updates across different agent models. The harness evolved on

한 문장 요약

롤아웃(trajectory) 기록을 진단해 시스템 프롬프트, 규칙 은행, 안전 메모리, 도구 정책의 네 가지 편집 가능한 하니스 아티팩트만 국소적으로 수정하는 반복적 검증-선택 루프(SHE)로 LLM 에이전트의 안전 경계를 학습·진화시켜 공격 성공률을 낮추고 정상 유틸리티를 보존한다.

해결하려는 문제

기존 에이전트 안전 방식은 하니스(harness)를 배포 시 고정된 아티팩트로 취급해 실행 중 발생하는 새로운 위험에 자동으로 적응하지 못하고, 하니스 내부 기능들이 결합되어 있어 특정 실패를 어느 구성요소가 책임지는지 명확히 속성화(attribution)하기 어렵다. 이에 따라 롤아웃 궤적에서 드러난 실패를 안전 경계 개선으로 연결(진화)하는 방법이 부재하며, 국소적·회귀 방지적인 하니스 수정을 자동화하는 연구 질문이 남아있다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(제목, 본문 섹션, 표와 부록 포함)에 근거해 작성되었다. 주요 정량 결과와 실험 설정(모델, 라운드 수, 태스크 분할, 평가자 모델 등)은 본문과 Appendix에 명시된 수치를 직접 인용했다. 표의 세부 항목들(조건별 모든 숫자) 중 일부는 본문 요약 수치로 대체하여 기술했으므로, 표의 셀별 모든 값을 재구성한 것은 아니다. 추가 세부(예: 편집 생성 내부 모델 프롬프트, 후보 편집 수 등)는 PDF에 자세히 기재되지 않거나 명시적 수치로 제공되지 않아 포함하지 않았다.