arxiv-wiki

Chain-of-Experience for Continual LLM Improvement

← 2026-08-19 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Summarized results on four benchmarks across math, code, and knowledge over

Figure · 원문 PDF 2쪽 · Figure 1: Summarized results on four benchmarks across math, code, and knowledge over

Figure 2: An overview of our studies iterative improvement loop for LMs. The model M

Figure · 원문 PDF 4쪽 · Figure 2: An overview of our studies iterative improvement loop for LMs. The model M

Figure 3: Results of five state-of-the-art LLMs on six benchmarks using different generation

Figure · 원문 PDF 6쪽 · Figure 3: Results of five state-of-the-art LLMs on six benchmarks using different generation

한 문장 요약

Chain-of-Experience(CoE)를 제안하여 LLM이 테스트 시점에 반복적 상호작용과 다양한 피드백(자기비판·실행·정확성 등)을 누적해 스스로 성능을 향상하도록 하고, 이를 8개 최신 LLM과 수학/코드/지식 벤치마크에서 체계적으로 검증했다.

해결하려는 문제

기존 LLM 평가와 테스트-타임 전략들은 대부분 단일 추론 또는 임시적 후처리(verifier·병렬 생성에서 선택 등)에 머물러, 모델이 추론 시간에 환경·자기 피드백을 누적해 지속적으로 개선하는 능력(learning-from-experience)을 무시한다. 본 논문은 ‘테스트 시점에 반복적 상호작용을 통해 경험을 축적하면 모델이 어떻게 개선되는가’라는 질문을 다루며, 기존 self-refinement·검색·메모리 기반 방법들이 경험을 일시적으로만 활용하거나 중간 추론 단계를 손실할 수 있다는 한계를 지적한다.

핵심 기여

접근 방법

주요 결과

(수치 출처: 본문 Fig.5, Section 4.2 및 Table 3·5·1·2·표현된 문장들.)

한계

[확인가능] 메모리 압축(요약/선별) 방법의 한계: Dynamic CheatSheet(DC)나 SimpleMem처럼 경험을 요약·압축하는 방법들이 동일 태스크 내에서 전체 경험 트레일보다 성능이 낮게 나와(본문 Table 1·J), 과도한 압축이 중간 추론 정보를 잃을 위험이 있음.

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문·표·그림·부록 언급 포함)을 근거로 작성하였다. 수치와 실험 결과는 본문 및 표·그림에서 직접 확인 가능한 값만 인용했다. 프롬프트·구체적 하이퍼파라미터와 일부 세부 구현(부록 A·D 등)은 PDF 본문에 요약되어 있으나 전체 프롬프트 텍스트·코드 수준의 재현세부는 부록 참조가 필요하므로, 그 부분에 대해서는 본문 텍스트를 기반으로 요약·해석하였다.