arxiv-wiki

InjecMEM: Memory Injection Attack on LLM Agent Memory Systems

← 2026-08-25 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: InjecMEM attack pipeline. The attacker inputs adversarial prompt, memory logs it.

Figure · 원문 PDF 2쪽 · Figure 1: InjecMEM attack pipeline. The attacker inputs adversarial prompt, memory logs it.

Figure 2: An example of indirect memory injection through compromised tools.

Figure · 원문 PDF 9쪽 · Figure 2: An example of indirect memory injection through compromised tools.

Figure 3: High-level agent architecture. Left shows the agent core. Middle shows external

Figure · 원문 PDF 19쪽 · Figure 3: High-level agent architecture. Left shows the agent core. Middle shows external

한 문장 요약

단일 상호작용으로 에이전트 메모리 저장물을 조작해 특정 주제 질의에서 미리 지정한 출력을 유도하는 ‘InjecMEM’ 공격을 제안하고, 주제 유도(anchor)와 강건한 명령(command)을 결합해 검색·생성 파이프라인에서 작동하도록 최적화하는 방법을 제시한다.

해결하려는 문제

메모리 모듈을 가진 LLM 에이전트는 장기 개인화와 연속성 제공을 위해 상호작용을 지속적으로 기록·검색하는데, 이러한 지속적 쓰기·하드리브리벌(혼합 신호 기반) 구조가 새로운 공격 표면을 생성할 수 있다. 기존 RAG/데이터베이스 포이즈닝 기법들은 정적 인덱스·고정된 임베딩 기하 가정을 전제로 하므로, 메모리 드리프트(시간에 따른 저장물 증가·문맥 융합), 변수적 위치, 혼합(lexical+embedding) 검색 신호 등 실제 메모리 시스템의 불확실성 앞에서 실패한다. 연구 질문은 ‘읽기/편집 접근 없이(단 한 번의 상호작용만으로) 메모리 시스템에 지속적으로 기록되는 항목을 통해 이후 관련 주제 질의에서 공격자가 원하는 출력을 유발할 수 있는가, 그리고 이를 어떻게 설계·최적화·평가할 것인가’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 본 분석은 제공된 논문 PDF 본문(메인 텍스트 및 부록) 내용을 바탕으로 작성되었음. 주요 수치(표 및 본문 요약)는 PDF에 명시된 값을 그대로 인용했다. 다만 알고리즘 하이퍼파라미터(Alg.1의 구체적 K/W/R/T 값 등)와 일부 구현·계산 비용 관련 세부치는 PDF 본문에서 통일된 수치로 모두 제시되지 않아 해당 항목은 명시적으로 재현·추가 확인이 필요함.