arxiv-wiki

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

← 2026-08-28 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: RedEvoAgent overview. Given a jailbreak prompt, the attacker agent uses the current

Figure · 원문 PDF 2쪽 · Figure 1: RedEvoAgent overview. Given a jailbreak prompt, the attacker agent uses the current

Figure 2: Skill evolution from attack experience. (a) On the training split, RedEvoAgent collects

Figure · 원문 PDF 5쪽 · Figure 2: Skill evolution from attack experience. (a) On the training split, RedEvoAgent collects

Figure 3: Validation-ratchet evolution. The x-axis is the maximum number of ratchet rounds R;

Figure · 원문 PDF 9쪽 · Figure 3: Validation-ratchet evolution. The x-axis is the maximum number of ratchet rounds R;

한 문장 요약

제품 수준의 블랙박스 에이전트에서의 탈옥(jailbreak) 취약점을 자동으로 탐지하기 위해, 교차 사례의 공격 궤적을 간결한 자연어 ‘공격 스킬’로 증류하고 도구 효능 프로파일·결정도구(Deciding-Tool) 귀속·검증 래칫으로 스킬을 점진적으로 진화시키는 RedEvoAgent를 제안한다.

해결하려는 문제

LLM 기반 에이전트가 제품 수준 실행 허니스를 통해 파일 수정, 외부 API 호출 등 도구 사용과 영구 상태 변경을 할 수 있게 되면서 탈옥 공격의 위험이 확대되었다. 기존 자동 레드티밍은 고정된 공격 방식이나 궤적 기반 검색(retrieval)에 의존하는데, 궤적 검색은 유사도 편향으로 인해 오해를 낳거나 어떤 도구 선택이 실제 성공에 기여했는지 불명확하여 잘못된 경험을 재사용하고 최적화 불안정을 초래한다. 또한 전체 궤적을 맥락으로 넣으면 컨텍스트 오버헤드와 해석성 저하가 발생한다. 본 논문은 이러한 한계를 해결하여 재사용 가능한 고수준의 공격 전략(스킬)을 자동으로 학습·진화시키는 방법론을 제시한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(모든 페이지)에서 직접 추출한 정보에 기반한다. 본문에 명시된 수치(예: ASR/HarmScore, 실험 설정: 공격자 모델 GPT-4o mini, B=20, R=4, 미니배치=8, L=6, seed=42)와 표·그림의 결과만을 사용했다. 본문에 상세히 서술되지 않은 내부 구현의 미세한 파라미터나 추가 실험(예: 비용 산출의 세부 내역, 일부 내부 로그 포맷 등)은 PDF에서 확인되지 않아 생성하지 않았음을 밝힌다.