SENTINEL-RL: Offloading Topological Reasoning from LLM Agents in the Security Operations Center
- 게시일: 2026-09-05
- arXiv: 2609.04159v1 · PDF
- 저자: Uday Vallabhaneni, Cassie L. Cagwin, David J. Wild
- 분야: cs.CR, cs.AI
- 선정 점수: 4.82
- 선정 이유: 최근성 0.8, 인용 영향 0.0 (인용 0회), 저자 영향 0.0 (최고 h-index 0), AI 주제 적합성 3.0, 개발자 관심 0.6, 학술 신호 0.5, 오픈 웨이트·주요 연구조직 신호 0.0
← 2026-09-05 목록으로 돌아가기
한 문장 요약
대규모 인증 그래프에서의 토폴로지적 추론을 LLM에서 분리하여 HetGAT로 서브그래프를 64차원 상태로 요약하고 PPO 정책으로 제약된 조사·격리 행동을 선택하며 LLM은 판정 설명과 크리틱 역할만 수행하는 신경-심볼릭 SOC 아키텍처를 제안한다.
해결하려는 문제
기존 접근법의 한계로 (1) LLM의 유한한 컨텍스트 창이 수천~수만 호스트에 대한 인증 그래프 전체를 담을 수 없어 측면이동 공격 추적에 실패하거나 근거 없는 추정을 하게 되고, (2) 자유형 텍스트 생성은 격리·차단 같은 실제 인프라 조치가 네트워크 토폴로지와 일치하는지 보장하지 못해 운영상 위험과 감사 불일치를 초래한다. 연구 질문은 이러한 구조적 한계를 극복하면서 실시간 탐지→조사→권고→인간승인 사이클을 안전하고 실용적으로 자동화하는 방법이다.
핵심 기여
- 토폴로지 추론과 의미적 추론을 분리한 Sentinel-RL 네 계층(데이터·전략·텔레메트리·오케스트레이션) 아키텍처 제시.
- 대규모 인증 로그 병렬 삽입 시의 hot-node 데드락을 회피하는 두-단계(정점 사전 생성 + 병렬 엣지 CREATE) CREATE 기반 ingestion 패턴과 그 정량적 성능 개선 보고.
- HPC 환경에서 반응형 마이크로서비스의 내부 통신 문제를 해결하는 anchor-node(모든 인터랙티브 서비스 동시 배치) 배포 패턴 제시.
- HetGAT로 2-hop 서브그래프를 64차원 상태로 임베딩하고 PPO(5개 제약 행동)로 결정하는 전략 평면을 구현·학습시켜 보유한 LANL red-team 기준에서 높은 정밀도와 재현율 달성.
- 기업 도입을 위한 안전 표면(액션 마스킹, 불변 감사 로그, 롤백스크립트, 샌드박스 검증, 인간 승인 경계) 및 운영·비용 분석 제공.
접근 방법
- 아키텍처: 네 계층(데이터 플레인: Neo4j로 Host/User/Service/NetworkSegment와 Auth 관계 저장, 텔레메트리 플레인: 슬라이딩 윈도우 트립와이어, 전략 플레인: HetGAT+PPO 정책, 오케스트레이션 플레인: LangChain 기반 LLM 트리아주와 크리틱, Streamlit UI)으로 분리했다.
- 그래프 처리·인제스트: 두-단계 CREATE 패턴을 사용하여 먼저 모든 정점을 순차적으로 MERGE(사전 물질화)한 뒤 병렬 워커가 MATCH 후 CREATE로 엣지를 삽입하여 Neo4j의 쓰기 락 충돌을 회피한다.
- 상태 표현 및 정책: 의심 호스트 주변 2-hop 서브그래프를 HetGAT로 64차원 벡터 s_t로 인코딩하고, PPO(clip objective) 기반 정책이 다섯 개의 엄격히 정의된 조사/행동 {QueryEDR, QueryAD, CheckThreatIntel, ExamineFirewall, TerminateAndOutputVerdict} 중 하나를 선택한다.
- 정책은 독립 FastAPI 마이크로서비스로 배포되어 버전·감사 제어가 가능하다.
- 텔레메트리/트리거: 슬라이딩 윈도우 파라미터 (W=10 s, N=25)로 빠르게 공격성 인증 스파이크를 탐지하고 웹훅으로 오케스트레이션을 호출한다.
- 안전성: 내부 크리틱이 제안 행동의 증거를 검증하고, 액션 마스킹으로 irreversible 행동을 최소 두 출처의 증거 필요 등으로 제한하며 불변 감사 로그·롤백 스크립트·샌드박스 시뮬레이션을 통해 실행 전 검증한다.
- 학습·운영 절차: PPO은 Ray RLlib 기반으로 학습하되 정책을 서비스화하여 섀도우 배포 가능하게 했고, Ray 2.x의 RLModule/Learner API 마이그레이션을 위해 하이퍼파라미터 매핑(Table I)을 적용했다.
주요 결과
- 대규모 인제스트: 24,000,000 엣지(약 하루 분 인증 로그)를 단일 32코어/128GB 노드의 two-phase CREATE 파이프라인으로 852초(=14.2분)에 로드함. 단일-페이즈 MERGE 파이프라인은 동일 환경에서 락 충돌로 성능 저하가 심해 6시간 캡 후 선형외삽으로 21,600초가 필요하다고 보고하여 약 24× 처리량 개선을 주장함(논문에서 MERGE의 24M 값은 4시간 관측 구간 기반으로 선형 외삽되었음).
- Alert 트리거 지연: 슬라이딩 윈도우 (10s, 25 이벤트) 구성에서 50회 실험의 웹훅 지연 평균 2.31 s, 99백분위 2.45 s, 최대 2.48 s를 기록하여 ≤2.5 s 범위로 안정적으로 알림을 생성함.
- PPO 학습·탐지 성능: PPO를 200 반복(iterations) 동안 학습시킨 결과 5개 시드 평균 에피소딕 리턴 8.74 ± 0.31로 안정 수렴함(이론적 최대 9.0). 보류된(held-out) LANL 마지막 8일 분에 평가한 탐지 성능은 정밀도 0.91 ± 0.02, 재현율 0.87 ± 0.03, F1 0.89 ± 0.02, AUC 0.96 ± 0.01임(표와 본문 수치).
- 엔드투엔드 지연: 탐지→조사→권고→인간승인 전 사이클의 중앙값 지연은 6.33 s임. 세부 중간값: AlertEngine 트리거 2.31 s(36.7%), 서브그래프 추출 0.08 s, HetGAT 인코딩 0.05 s, PPO 추론 0.04 s, 크리틱 검증 0.07 s, LLM 내러티브 합성(로컬 8B 4-bit 모델) 3.78 s(전체의 약 60%).
한계
- 저자가 명시한 한계: 시스템은 LLM의 환각을 전제로 내부 크리틱·정책 감사·인간승인 경계를 통해 신뢰를 확보하도록 설계되었으며, 정책이 항상 최적이라는 가정은 하지 않는다.
- 저자가 명시한 위협 모델 제약: 공격자 모델을 ‘자격증명 남용(credential abuse) 및 원격 서비스 악용’ 중심으로 한정하고 있어 제로데이·OS 익스플로잇 등 다른 침투 방식은 평가 대상에서 제외됨.
- 실험·범위에서 확인되는 제약(추론된 한계): 평가가 LANL 데이터셋과 Indiana University Quartz 클러스터라는 특정 실환경에 국한되어 있어 타 조직 네트워크·다른 로그 유형·다른 클러스터 네트워크 구성에서의 일반화 가능성은 본문에서 직접 증명되지 않았다.
- MERGE 대비 성능 비교의 한계: 24M 엣지에 대해 MERGE 파이프라인의 전체 시간은 6시간 캡 이후 선형 외삽으로 산정되었고, 이는 실제 장기 실행에서의 정확한 측정값과 차이가 있을 수 있다(논문 표기).
LLM 병목: 전체 지연의 대부분(약 60%)이 로컬 8B 4-bit LLM의 자연어 합성으로 발생하며, 이 모델 선택·배치 방식에 따라 실시간성에 민감한 환경에서 성능 제약이 존재한다.
공격자 적응성·적대적 평가가 없음: 적대적 적응이나 모방 공격(attackers adapting to agent behavior)에 대한 견고성 검증은 본문에서 다루어지지 않았다.
개발자 관점
- 대규모 인증 로그를 Neo4j로 병렬 삽입할 때는 정점 사전 물질화(순차 MERGE) 후 병렬로 MATCH+CREATE 엣지 삽입하는 두-단계 CREATE 패턴을 사용해 락 경합을 회피하라(논문의 Listing 1 쿼리 참조).
- HPC(SLURM) 환경에서는 상호작용적·지연 민감 서비스(Neo4j, 정책 엔드포인트, UI 등)를 단일 anchor node에 공동 배치해 루프백 통신을 활용하라(논문의 anchor-node 패턴).
- 정책은 독립된 서비스(FastAPI)로 운영하여 버전관리·셔도우 배포·긴급 교체가 가능하도록 설계하라. 이는 모델 교체 시 전체 재배포를 피하게 해 안전상 중요하다.
- Ray/RLlib 업그레이드에 따른 API 변화를 대비해 논문 Table I의 레거시→현대 매핑을 참고해 하이퍼파라미터를 옮겨라(예: train_batch_size 등).
- 운영 준비성 측면에서는 액션 마스킹, 불변 감사 로그, 각 제안 행동에 대한 자동 롤백 스크립트 첨부, 샌드박스 시뮬레이션, 그리고 인간 승인 경계를 반드시 구현해야 한다(논문 Section VII의 구체적 제어 표면 참고).
실행 자원 계획: 저자 실험은 GPU 없이 32코어/128GB 노드에서 수행되었으므로 동일한 배포를 염두에 둘 경우 유사한 노드 스펙을 준비하되, LLM 합성 병목을 줄이려면 더 빠른 모델이나 병렬화 전략을 고려해야 한다.
재현성: 논문은 Cypher 사전 물질화 쿼리, AlertEngine 임계값(25/10s), PPO 하이퍼파라미터 매핑, SLURM anchor-node 할당 전략을 명시하므로 이를 그대로 따라하면 결과 재현이 가능하다.
근거 범위: 이 분석은 제공된 논문 PDF 본문을 근거로 작성되었음. 본문 내 수치·설명(예: ingestion 시간, 경고 지연, PPO 수렴값, 정밀도/재현율, 엔드투엔드 지연 등)을 직접 인용하였다. 단, MERGE 방식의 24M 엣지 처리 시간은 논문이 6시간 캡 후 선형 외삽으로 산정했음을 명시하고 있으므로 해당 비교 수치는 외삽 기반임을 유의해야 한다. LLM 관련 구현은 본문에 ‘로컬 8B 파라미터 모델 4-bit 양자화’로 표현되어 있어 모델명 등 추가 세부사항은 PDF에 명시되지 않았다.