arxiv-wiki

Chained Recursive Language Models for Multi-Iteration Reasoning

← 2026-08-06 목록으로 돌아가기

한 문장 요약

긴 컨텍스트 추론 문제에서 동일한 LLM을 여러 번 ‘신선한’ 루트로 호출하고 평문(summary, blackboard, artifacts)을 통해 중간 산출물을 인계하면서 단계별로 검사·수정해 최종 응답 정확도를 높이는 추론-시스템 설계(Chained RLM)를 제안한다.

해결하려는 문제

단일 LLM 호출로 긴 문서나 다중 단계 추론을 수행하면 모델이 증거 추출·중간 상태 관리·검증·최종 응답 생성을 하나의 추론 궤적에서 동시에 처리해야 하므로 초기의 추출·집계 실수가 이후 단계로 전파되어 성능이 저하되는 문제(예: counting, ordering, multi-hop). 기존 기법(코드-오브-사고, self-consistency, RLM 등)은 중간 상태를 내부 궤적으로 유지하거나 도구 호출을 섞지만, 단일 궤적의 stale한 내부 상태로 인해 오류가 고착화될 수 있다는 한계가 있다. 연구 질문은 ‘동일 모델을 여러 번의 fresh root로 호출하고 중간 산출물을 평문으로 전달하면(artifact continuation) 직접 답변이나 재귀적 도구 호출보다 정확도가 개선되는가’이다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Chained RLM architecture with 3 RLM calls.

Figure · 원문 PDF 2쪽 · Figure 1: Chained RLM architecture with 3 RLM calls.

근거 범위: 논문 PDF 본문(제공된 페이지 1–9)을 근거로 분석을 작성했다. 표와 알고리즘, 시스템 프롬프트 등 본문에 명시된 내용에 기반해 수치와 절차를 보고했다. 다만 일부 실험 세부(랜덤 시드, 샘플링 파라미터, 체인 길이/루트별 상한의 구체적 실험 설정, compute-matched 비교의 상세 구성 등)는 본문에 자세히 기재되어 있지 않아 해당 항목에 대해서는 명시적 숫자를 재구성하지 않았다.