arxiv-wiki

What is Missing from AI Post-Training AI: An Empirical Analysis

← 2026-08-20 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Agents can execute an extended post-training pipeline, while their training strategies re-

Figure · 원문 PDF 2쪽 · Figure 1: Agents can execute an extended post-training pipeline, while their training strategies re-

Figure 2: Distribution of agent behavior across different activities throughout the post-training pro-

Figure · 원문 PDF 6쪽 · Figure 2: Distribution of agent behavior across different activities throughout the post-training pro-

Figure 4: Agent adopts all execution-level sugges-

Figure · 원문 PDF 6쪽 · Figure 4: Agent adopts all execution-level sugges-

한 문장 요약

LLM 에이전트들이 LLM 후속학습(post-training)을 실행하는 능력은 충분하지만, 대규모 궤적 분석과 통제된 개입 실험을 통해 전략(훈련 패러다임·데이터·단계 구조)을 사전에 고착(lock‑in)시키고 실행 중 자발적으로 재평가하지 못하는 ‘전략 수준’ 재고(reevaluation) 메커니즘의 부재를 규명하고, 경험·가이드·추론 자원별로 점증적 개입을 시험해 원인을 규명했다.

해결하려는 문제

기존 논의는 에이전트의 ‘AI-for-AI’ 능력을 하나로 묶어 보지만, 본문은 이를 실행 수준(execution-level)과 전략 수준(strategy-level) 능력으로 분리한다. 관찰된 문제는 (1) 에이전트들이 후속학습 파이프라인을 구현하고 반복 실험을 수행하는 실행 능력은 갖추었으나, (2) 훈련 전략을 실행 초기에 고정(lock‑in)하고 이후 예측·평가 결과가 쌓여도 상위 전략(예: SFT↔PEFT↔RL 전환)을 스스로 재평가·전환하지 못해 전반적 성능 상한이 초기 전략에 의해 정해진다는 것임.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문, 표, 그림 캡션, 부록)에서 직접 추출한 근거를 기반으로 작성함. 숫자와 실험 세부사항은 본문에 명시된 값만 사용했으며, 외부 자료나 원저자와의 추가 확인 없이 해석한 부분(예: 일반화 한계, 구현 권고)은 본문 근거에 기반해 합리적으로 도출했음을 밝힘. PDF에서 표·그림의 일부 캡션·세부 문구를 인용했으나, 그림의 시각적 세부(예: 정확한 플롯 축값)는 텍스트에서 명시된 수치로만 보완했음.