arxiv-wiki

Language Models Can Control Their Own Attention

← 2026-09-04 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Declarative Attention (DA) lets a model control its own attention span. (Prompt) A system instruction, long

Figure · 원문 PDF 1쪽 · Figure 1: Declarative Attention (DA) lets a model control its own attention span. (Prompt) A system instruction, long

Figure 2: DA’s efficiency comes from attention masking rather than shorter generation. Accuracy, decode steps, and

Figure · 원문 PDF 9쪽 · Figure 2: DA’s efficiency comes from attention masking rather than shorter generation. Accuracy, decode steps, and

Figure 3: DA accuracy scales favorably with backbone size. Metrics are normalized to each model’s vanilla baseline

Figure · 원문 PDF 9쪽 · Figure 3: DA accuracy scales favorably with backbone size. Metrics are normalized to each model’s vanilla baseline

한 문장 요약

모델의 생성 중 체인-오브-생각(Cot) 출력으로 자신이 어느 문맥을 볼지 선언하게 해 KV 캐시 전체 읽기를 건너뛰는 ‘Declarative Attention(DA)’ 프로토콜을 제안하여 장기 문맥 추론의 attention 비용을 크게 줄인다.

해결하려는 문제

Transformer 계열 LLM은 매 디코드 스텝마다 전체 KV 캐시를 읽어 attention을 계산하므로 긴 문맥에서 KV 읽기(메모리 대역폭)가 디코드 비용을 지배한다. 기존 해법은 관련 토큰을 외부 스코어로 선별하지만 이들 방식도 여전히 스텝당 O(N) 스캔 또는 근사 스캔 비용을 발생시킨다. 논문은 ‘모델이 자신이 어디를 볼지 이미 알고 있지 않나?’라는 질문에서 출발해, 모델이 스스로 주석(태그)으로 향후 attention 범위를 선언하면 선택 비용을 제거할 수 있는지 탐구한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문과 부록 포함)의 텍스트를 근거로 작성되었음. 입력에 일부 페이지 반복·중복 추출이 포함되어 있었으나 본문(핵심 섹션 1–6, 실험 설정, 표와 수치, 부록 D·F 등)을 직접 참조해 수치와 구현 세부를 정리했다. 본문에 명시되지 않은 초미세 구현 파라미터(예: 내부 블록 크기 선택의 최종 값, 실제 서빙 환경에서의 측정 wall-clock)는 기술하지 않았으며 해당 항목은 본문 추정치(예: TFLOP, GB 수치, MFU/MBU 가정)로만 보고되었음을 밝힌다.