arxiv-wiki

CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents

← 2026-08-31 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Overview of CamoDocs.

Figure · 원문 PDF 1쪽 · Figure 1: Overview of CamoDocs.

Figure 2: Overview of CamoDocs. CamoDocs generates benign and adversarial sub-documents, optimizes the

Figure · 원문 PDF 3쪽 · Figure 2: Overview of CamoDocs. CamoDocs generates benign and adversarial sub-documents, optimizes the

Figure 3: Analysis of document embeddings. (Left) A t-SNE visualization of query, benign, and adversarial

Figure · 원문 PDF 8쪽 · Figure 3: Analysis of document embeddings. (Left) A t-SNE visualization of query, benign, and adversarial

한 문장 요약

외부 지식 베이스에 은밀히 위조 문서를 삽입해 쿼리 미포함 상태로 문서 임베딩을 분산시켜 RAG 시스템을 오도하는 공격 기법(CamoDocs)을 제안하고, 여러 방어·모델·리트리버에서 효과와 한계를 실험적으로 분석한다.

해결하려는 문제

Retrieval-augmented generation(RAG)은 외부 문서를 활용해 LLM 출력을 보강하지만, 공개·사용자 편집 가능한 지식베이스는 문서 주입(데이터 포이즈닝)에 취약하다. 기존 포이즈닝 공격은 공격 문서에 목표 쿼리를 직접 포함(query inclusion)하여 검색·순위에서 유리하게 만들지만, 이는 문장·임베딩 공간에서 명확한 이상 신호를 남겨 필터링(예: 쿼리 탐지, 군집 기반 차단)에 취약하다. 본문은 쿼리 포함 없이도 은밀하게(stealthy) RAG를 오도할 수 있는 방법과, 이러한 공격이 기존 방어(특히 군집·지우기 기반 방어)에서 어떻게 작동하는지 규명하는 것을 질문으로 삼는다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 논문 PDF 본문(Appendices 포함) 기반으로 분석·요약함. 본문에 명시된 표(Table 1–9, 부록 표들), 수치(예: ASR, 제거 비율, PPL, 런타임)와 알고리즘(Algorithm 1, Algorithm 2)·하이퍼파라미터(ndraft, γ, β, α, m, m′ 등)를 직접 인용·요약했다. PDF에서 표·숫자 추출은 본문에 명시된 값을 따랐으며, 표의 일부 세부 항목(예: 각 모델·데이터셋별 모든 세부 ASR 항목)은 본문 표를 참조하였음. 구현 세부(예: 정확한 토큰화·색인 파이프라인)는 저자가 제공한 설정(부록)에 기반해 기술했으며, 환경·리트리버·전처리 차이에 따라 재현성·전이가 달라질 수 있음.