arxiv-wiki

A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

← 2026-08-27 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Overview of our self-evolving multi-agent defense framework. A1 (Rule Triggering Agent) classifies

Figure · 원문 PDF 4쪽 · Figure 1: Overview of our self-evolving multi-agent defense framework. A1 (Rule Triggering Agent) classifies

Figure 2: ASRgpt over sequential interaction rounds on

Figure · 원문 PDF 7쪽 · Figure 2: ASRgpt over sequential interaction rounds on

Figure 3: Ablation results on CodeChameleon across

Figure · 원문 PDF 7쪽 · Figure 3: Ablation results on CodeChameleon across

한 문장 요약

운영 중 발생한 성공한 jailbreak 실패를 구조적 ‘랩퍼’ 수준의 재사용 가능한 규칙으로 추상화해 외부 영구 규칙 메모리에 저장·선택적 발동함으로써(파라미터 업데이트 없이) 블랙박스/오픈 모델에 대해 테스트타임에서 자기진화적으로 방어력을 높이는 다중 에이전트 프레임워크를 제안한다.

해결하려는 문제

기존 LLM 안전 방법(고정 시스템 프롬프트, 안전 파인튜닝, 외부 분류기 등)은 배포 시 고정되어 새로운 혹은 조합적·난독화된 jailbreak 기법에 적응하지 못한다. 본문은 연속 상호작용 환경에서 발생하는 새로운 탈옥 전략에 대해 시스템이 경험을 축적해 적응할 수 있는 테스트타임 방어가 부족하다는 문제를 다룬다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제출된 논문 PDF 본문(제목·초록·서론·방법·실험·부록 포함)의 텍스트를 근거로 작성되었다. 표·그림·부록(A.6 포함)에 제시된 수치(표 1, 표 3, XSTest 결과, 호출·지연 오버헤드 등)와 알고리즘·프롬프트 템플릿을 직접 인용했다. PDF에서 제공되지 않은 내부 파라미터나 구현 세부(예: LLM 프롬프트의 세부 튜닝, 정확한 비용 산정 방식)는 생성하지 않았으며, 문서에 명시된 한계와 본문으로부터 합리적으로 확인되는 제약을 구분해 기술했다.