arxiv-wiki

Recirculation

← 2026-08-19 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Example of a contextualization error that results from failure to track state. This example

Figure · 원문 PDF 2쪽 · Figure 1: Example of a contextualization error that results from failure to track state. This example

Figure 2: A schematic depiction of transformer activations in processing the example of Figure 1.

Figure · 원문 PDF 3쪽 · Figure 2: A schematic depiction of transformer activations in processing the example of Figure 1.

Figure 3: (a) A transformer in which recurrent connections are introduced from layer 6 back to layer

Figure · 원문 PDF 5쪽 · Figure 3: (a) A transformer in which recurrent connections are introduced from layer 6 back to layer

한 문장 요약

사전학습된 트랜스포머에 추론 시 recurrent 연결을 주입해(깊은 층의 활성화를 얕은 층으로 일부 누출) 상태 추적 능력을 향상시키는 ‘recirculation’ 기법을 제안하고, 학습 없이도 perplexity와 여러 다운스트림 정확도를 크게 개선할 수 있음을 실험으로 보였다.

해결하려는 문제

표준 피드포워드 트랜스포머는 층(depth)에 의해 직렬(state-update) 용량이 제한되어 있어 문맥적 의미의 지연된 정착(delayed contextualization)이나 상태 추적 실패(예: 다의어 ‘bank’의 의미 반전 무시)가 발생한다. 이로 인해 장문 문맥, 다중 턴 대화, 추론/작업들에서 일관성·추론 성능 저하가 생긴다. 기존의 해결책(사전학습된 recurrent transformer로 재학습, chain-of-thought 등)은 비용이 크거나 목적(복잡한 추론)과 혼동될 수 있으며, 추론 시점(inference-time)에 적용 가능한, 학습비용이 낮은 아키텍처적 개선이 필요하다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문 및 부록)을 근거로 작성되었다. 표와 수치(예: Table 1, Figure 12, Figure 13, Section 4.6)의 값과 저자의 한계·방법 기술은 PDF 본문에서 직접 인용·요약하였다. PDF 텍스트는 전반적으로 완전했으나 도식·세부 코드·추가 실험 로그 등은 본문에 없는 경우가 있어 구현 세부(예: 블록 단위 K 값의 최적화, 하드웨어별 연산비용 정량 등)는 본문에 근거해 재구성하지 않았다.