arxiv-wiki

AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs

← 2026-08-27 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: ASYMSPEC speculation step. (a) Drafting & verification: drafter S reads xfull (logits a, drafts d1:K) and

Figure · 원문 PDF 4쪽 · Figure 1: ASYMSPEC speculation step. (a) Drafting & verification: drafter S reads xfull (logits a, drafts d1:K) and

한 문장 요약

긴 컨텍스트가 압축된 상황에서, 경량 drafter가 전체 입력을 읽고 압축된 대형 verifier를 대조적(δ) 로짓 융합과 divergence-민감 수용 게이트로 조종해 거의 전체 문맥 정확도를 저비용으로 회복하는 비대칭 speculative decoding 프레임워크를 제안한다.

해결하려는 문제

대형 LLM 기반 에이전트 파이프라인은 검색, 툴 호출, 다중 턴 누적으로 컨텍스트가 길어지며 추론 비용이 급증한다. 실제 배포에서는 입력을 압축해 지연을 제어하지만 압축은 정확도를 크게 저하시킨다. 기존의 speculative decoding(SD)은 drafter와 verifier가 동일한 컨텍스트를 전제로 하므로, 압축으로 손실된 정보를 복구하지 못해 정확도–오버헤드 간 트레이드오프를 해결하지 못한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–20 및 부록 A–G) 기반으로 작성되었다. 본문에서 직접 명시된 알고리즘(δ-fusion, CDA 수식, Algorithm 1), 하이퍼파라미터(K, β, γ), 실험 결과 표(Table 1–21), 구현 패치(섹션 E) 및 저자가 명시한 한계들을 근거로 정리했다. PDF에 포함되지 않았거나 본문에서 상세히 기술되지 않은 미세한 구현 세부사항(예: 특정 런타임 커널 최적화, 하드웨어별 배치 전략)은 재구성하지 않았으며 그 부분은 원저자 구현 저장소를 참조해야 한다.