arxiv-wiki

Stealing Reasoning Traces from Proprietary LLM APIs

← 2026-08-12 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Decoding reasoning traces in Anthropic, OpenAI and Google APIs. Top: Reasoning-trace extraction in

Figure · 원문 PDF 2쪽 · Figure 1: Decoding reasoning traces in Anthropic, OpenAI and Google APIs. Top: Reasoning-trace extraction in

Figure 2: Injection schemes exploiting in- and cross-session compatibility. We find that available form of thought

Figure · 원문 PDF 5쪽 · Figure 2: Injection schemes exploiting in- and cross-session compatibility. We find that available form of thought

Figure 3: Prefilling Kimi K3’s reasoning changes the style of its visible responses. In this example, we observe

Figure · 원문 PDF 6쪽 · Figure 3: Prefilling Kimi K3’s reasoning changes the style of its visible responses. In this example, we observe

한 문장 요약

대형 LLM들이 클라이언트에 반환하는 암호화된 체인-오브- thought(추론 트레이스) 블록이 세션·사용자·모델 간에 호환되는 아키텍처적 취약으로 작동함을 보이고, 약한 동일 공급자 모델을 ‘디코더’로 이용해 대규모로 추론 트레이스를 복호·추출하는 실험적 방법과 악용 사례들을 제시한다.

해결하려는 문제

문제: 주요 LLM API 제공자들은 내부 체인-오브- thought(추론 과정)를 서버에 저장하지 않고 클라이언트로 암호화된 블록(베이스64 서명/암호문 형태)을 반환해 무상태(stateless)로 세션을 이어가게 한다. 이 설계는 저장 비용을 줄이나, 제공자 생태계 내에서 이 암호화 블록이 세션·사용자·심지어 모델 간에 호환되면(포팅 가능하면) 약한 모델을 이용해 강력한 모델의 숨겨진 추론을 사실상 복호·복사할 수 있다는 위험을 내포한다. 기존의 방어(모델 수준의 거부·시스템 필터)는 강력 모델에서 직접 추출을 막더라도, 호환성을 악용해 더 약한 모델이 서명된 블록을 평문으로 출력하게 만들면 우회될 수 있다. 연구 질문: (1) 암호화된 생각 블록의 호환성과 포팅 가능성이 실제로 공급자·모델 전반에서 존재하는가? (2) 이를 이용해 어떤 규모·형태의 정보(지적재산, PII, 자격증명, 유해 내용)를 추출·악용할 수 있는가? (3) 완화책은 무엇인가?

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문 섹션 및 그림·수치 포함)을 바탕으로 작성했다. 주요 정량값(예: 315,320 복호된 블록, 1,028 블록(0.3%)의 프라이버시 누출, 6,708 세션에서 328개(4.9%) 세션 누출, 367 PII·182 자격증명 등)과 실험적 세부는 논문 본문과 도표에서 직접 인용했다. 다만 논문은 공급자 내부의 암호 구현 세부를 공개하지 않았으므로 암호학적 내부 구조(키 관리 방식 등)는 확인 불가하고, 추출된 텍스트가 원본 평문과 정확히 일치하는지 여부는 저자도 보장하지 않음(토큰 수 추적을 기반한 간접 검증만 있음). 부록(C,D,A 등)에 더 상세한 구현·샘플이 있으나 본 요약은 본문 기준으로 정리했음을 밝힌다.