arxiv-wiki

SPADE: Self-Play in Adaptive Synthetic Executable Environments

← 2026-08-20 목록으로 돌아가기

한 문장 요약

SPADE는 단일 대형 언어모델(LLM)이 환경 설계자(Environment Designer)와 문제 해결자(Reasoning Agent) 역할을 번갈아 수행하면서, 실행 가능한 파이썬 코드로 표현된 MDP 환경을 자가 생성하고 hint 기반의 후회(regret) 보상으로 환경 난이도를 에이전트 능력의 최전선으로 맞추며 공동 진화시키는 자기 놀이(self-play) 강화학습 프레임워크다.

해결하려는 문제

대형 언어 에이전트의 지속적 자기개선에는 검증 가능한 상호작용 환경(pool of environments)이 대량으로, 그리고 학습 진척에 따라 적응적으로 확장되어야 하나 기존 방식(사람이 만든 고정 풀, 고정 합성기, 고정 검증자)은 환경 분포가 고정되어 에이전트가 환경을 소진하면 향상이 멈추는 한계가 있다. 또한 비균형적(self-play의 정보대칭성) 혹은 고정 생성기의 모드 붕괴 문제, 그리고 단일-턴 문제(terminal reward) 위주로는 장기적 에이전트 능력 확장이 어렵다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(본문, 표, 그림, 알고리즘, 예시 코드 카드 및 부록 일부 발췌)을 기반으로 작성되었다. 본문에서 직접 명시된 수치(예: 표 1의 백본별 성능, 서론·요약의 BFCL/ACEBench 개선치, 알고리즘·하이퍼파라미터 기술)를 사용했으며, 저자가 부록에 기재한 구체적 구현·추가 실험 결과 일부는 제공된 추출 범위에 포함되지 않으므로 그 내용은 확인되지 않았다. 본문에 명시되지 않은 세부 비용·인프라 수치 등은 생성하지 않았다.