EvoUndo: Recoverability-Constrained Self-Evolution for LLM Agent Harnesses
- 게시일: 2026-08-31
- arXiv: 2608.28363v1 · PDF
- 저자: Tanmay Sah, Dolly Sah, Harshul Jain, Tanya Sah
- 분야: cs.AI
- 선정 점수: 5.50
- 선정 이유: 최근성 0.5, 인용 영향 0.0 (인용 0회), 저자 영향 0.0 (최고 h-index 0), AI 주제 적합성 3.0, 개발자 관심 0.2, 학술 신호 0.3, 오픈 웨이트·주요 연구조직 신호 1.5
← 2026-08-31 목록으로 돌아가기
한 문장 요약
EvoUndo는 LLM 에이전트가 런타임에 자기 자신(harness)을 수정할 때 그 수정이 다양한 반사(역)상태에서도 복구 가능한지 검증하고, 증거(witness) 캡처·회복(u) 프로그램·효과 계약(Ce)을 합성·수정·진단하여 복구 가능성(recoverability)을 보장하는 폐쇄형 프레임워크이다.
해결하려는 문제
현대 LLM 에이전트는 프롬프트·툴·미들웨어·리소스·실행 하네스를 런타임에 수정할 수 있어 성능을 개선하지만, 성공적 수정이라도 이전 상태의 정보를 덮어쓰거나 구조적 변형을 일으켜 이후에 안전하게 되돌릴 수 없을 수 있다. 기존 연구는 주로 수정의 전향적(capability) 향상(J(m(S))>J(S))에 집중했으나, 장기적으로 자율적·지속적 시스템에서는 서로 다른(반사적·counterfactual) 상태 분포 Q에 대해 복구가 보장되어야 한다는 문제가 남아 있다. 연구 질문은 ‘복구 가능성을 제약(invariant)으로 두고 자가-진화(mutating) 수정을 탐색·검증하려면 어떤 표현, 진단, 언어적 능력이 필요한가’이다.
핵심 기여
- 복구 가능성(recoverability)-제약 자기진화 문제를 정식화하고, 수정(m), 증거 캡처(w), 회복(u), 타입화된 효과 계약(Ce)을 결합한 후보 표현 ξ=(m,w,u,Ce)와 반사 검증·진단·수정 루프를 제공하는 EvoUndo 프레임워크를 제안했다.
- 600개 미지(one-shot) 자가진화 과제에서 자연적으로 얻은 실패 집합을 구축하여, 197개의 능력 향상(capa-positive) 수정이 복구 검증에 실패함을 확인하고 이 자연 실패 은행을 고정 코호트로 분석했다.
- 복구 실패를 ‘그라운딩(상태 주소 정확도)’과 ‘표현력(복구 언어 능력)’ 병목으로 분리하고, 결정적 오라클 솔버로 L0에서 48/197이, 확장 언어 L1에서 191/197이 표현적으로 복구 가능함을 보였다.
- 프로토콜-고정 2×2 실험(D0/D1 × L0/L1)을 통해: 정확 주소 진단(D1)이 L0로 복구 가능한 S0 집단에서 성능을 크게 향상시키고(38/48, 79.2%), L1은 S1 집단의 대부분(142/143, 99.3%)을 회복시키나, 진단의 세분성은 모델에 따라 비단조적 상호작용을 보인다는(예: gpt-oss-120b에서 D1L1은 D0L1보다 성능 저하) 사실을 보고했다.
- 구현·평가적 기여: L0/L1 복구 언어 규격, 개발/숨김(Dev/Hidden) 반사 검증 프로토콜, 예산B(1..4) 기반 폐쇄형 합성 및 입증 기준(숨김 세트에 대해 Wilson 95% LCB ≥ τR=0.85)과 지표(Rescue@B 등)를 제시하고, gpt-oss-120b·Qwen3.8-27B 복제 실험을 수행했다.
접근 방법
- 주요 구성 요소 및 절차(논문 본문 기준):
- 후보 표현: 각 후보는 ξ=(m,w,u,Ce)로 표현되고, 실험에서는 m은 고정(m0)으로 잠금 상태, w(증거 캡처), u(회복 프로그램), Ce(효과 계약)만 수선 가능하다.
- 런타임은 독립적으로 E(m,s)=SnapshotDiff(s,m(s)) ∪ ExecutionTraceEffects(m,s)를 계산해 Ce가 관찰된 효과를 누락하지 않도록 검사한다.
- 복구 언어: L0(구성·프롬프트·툴·라우팅 관련 기본 primitives)과 L1(여기에 더해 미들웨어 인덱스, 이벤트 리스너, 샌드박스 파일, 소켓·자원 디스크립터, 다중 표면 순서 복구 등 구조적 primitives)를 구현하여 언어 게이트로 강제한다.
- 진단 그레인: D0(거친 타입별 결함 요약)과 D1(정확한 정규화된 상태 주소·순서·잔차를 포함한 정밀 진단)으로 구분해 개발(Dev) 상태에만 세부 피드백을 제공한다.
- 반사 검증(반환-왕복): 각 s∈Qdev∪Qhid에 대해 s →[w] z →[m] s’ →[u(·,z)] ŝ를 수행하고 타입화된 관찰 동등성 ŝ ≃Ce s를 검사한다.
- 개발 상태는 상태 수준 진단을 반환, 숨김 상태는 aggregate LCB만 반환한다(최종 입증 시 숨김 평가 필요).
- 합성·수선 루프: 복구 실패 시 예산 B∈{1,2,3,4} 내에서 (w,u,Ce)를 합성·재시도(모델 기반)하며, 구문 오류·언어 위반은 즉시 실패로 처리(fail-closed).
- 입장 기준은 숨김 세트에서 k/n 통과 시 Wilson 95% LCB ≥ τR = 0.85.
- 오라클 solvability 검사: 결정적 구성적 오라클(LLM 호출 없음)이 m의 AST와 완전한 사전 상태를 이용해 단일-패스으로 w,u를 구성해 언어별( L0, L1) 표현 가능성을 평가하여 실험적 층화(S0,S1)를 정의했다.
- 실험 설정: 6개 집단(각 100)으로 구성된 600-task 벤치마크(구성, 툴, 미들웨어, 리스너, 리소스, 다중표면).
- 주 모델은 gpt-oss-120b(온체인 MXFP4, temp=0.2)로 |Qdev|=10, |Qhid|=40(20 IID,20 OOD).
- 복제는 Qwen3.8-27B에서 수행.
주요 결과
- 제어된(의도적 결함) 120-task 벤치: 독립 재생성(strict regeneration) 4/120(3.3%), 일반 피드백 104/120(86.7%), 원시 검증자 트레이스 101/120(84.2%), 타입 진단 114/120(95.0%), 처방형 힌트 117/120(97.5%) -> 표현력이 언어에 포함될 때 폐쇄형 수선이 매우 효과적임.
- 600-task 자연 생성 후보 전체: 478/600(79.67%)가 능력-양성(mutative capability-positive) 결과를 생성; 이 중 281은 이미 허용, 122는 능력부족, 197은 능력-양성이지만 복구 검증 실패로 고정됨(이 197이 주요 코호트).
- 자연 실패 197건에 대한 표준 수선(기존 표현 L0 하)은 모두 실패(0/197)했음; 독립 재생성은 6/197(3.0%)만 회복.
- 오라클 solvability: 결정적 오라클 하에서 L0로 복구 가능한 것은 48/197, L1로는 191/197 -> 두 층 S0(48)과 S1(143)로 분리.
-
프로토콜-고정 2×2 결과 (전체 N=197, B=4): D0L0 0/197(0.0%); D1L0 38/197(19.3%); D0L1 180/197(91.4%); D1L1 167/197(84.8%). 상세: S0(48)에서 D1L0이 38/48(79.2%) 회복, S1(143)에서 D0L1이 142/143(99.3%) 회복. D1L1는 S1에서 133/143(93.0%)로 D0L1보다 성능이 낮아지는 비단조적 상호작용을 보임(논문은 gpt-oss-120b에서 유의미한 하락을 보고). (Table 2). 兩모델 대비: Qwen3.8-27B 복제에서 C1·C2 효과는 재현되었으나 D1L1의 부정적 상호작용은 재현되지 않음(모델-의존적임). (Table 3, Table 7).
-
주요 통계: S0 C1 대비 D1L0 − D0L0: ∆=+79.17 pp (95% CI [+66.67,+89.58], pHolm≈1.46×10−11). S1 C2 대비 D0L1 − D0L0: ∆=+99.30 pp (95% CI [+97.90,+100.00], pHolm≈1.08×10−42). C3 D1L1 − D0L1 on S1: ∆=−6.29 pp (95% CI [−11.19,−2.10], pHolm≈0.0117).
-
전체 회복 수치: D0L1(최종 실험 셋팅)에서 180/197(91.37%) 자연 실패를 구제해, 최종 능력-양성 허용은 461/478(96.44%), 전체 벤치마크 수율은 461/600(76.83%).
-
신선 홀드아웃(300 unseen tasks, L1 언어): 개발 세트 다양성 증가(Q2→Q20)는 개발→숨김 false positive를 16.8%→0%로 제거했으나 개발 기준 엄격화는 Rescue@4(100-hidden) 수율을 떨어뜨리는 정밀도-커버리지 트레이드오프를 보였음(예: Rescue@4 49.7%→35.0%, ∆=−14.67 pp, p≈5.76×10−6).
- 비용·오버헤드: 300-task fresh-holdout에서 호출당 평균 모델 콜 2.39–3.09, 생성 토큰 3.37k–4.30k; 주요 조건에서 폐쇄형 수선 평균 호출: D0L1 1.78 호출/과제, D1L1 1.95 호출/과제, D1L0 2.40 호출/과제; 모델 콜 대기시간 평균 5.25–5.85s(H200).
한계
- 저자 명시(논문 본문): (1) L0/L1 구현은 논문이 모델링한 하네스 상태 타입에 특화되어 있으며 완전성(completeness) 보장은 없음; 다른 런타임·스택으로의 전이는 미검증이다.
- (2) 복구 실험은 m(전향 수정)를 고정한 채 (w,u,Ce)만 수선함; m와의 공동 최적화나 m 자체의 트랜잭셔널 재설계는 평가하지 않음.
- (3) 타입화된 동등성·효과 추적은 인메모리 구성·프롬프트·라우팅·툴·미들웨어·리스너·가상 파일·관리 자원 핸들을 포함하지만 분산 DB, 다중 호스트 상태, 서드파티 API, 관리되지 않는 OS 프로세스, 외부 비모델 상태 등은 다루지 않음.
- (4) 물리적·금전적 비가역적 효과는 보상(compensation) 의미론이 필요하며 본 연구의 정확 복원 방식으로 해결되지 않음; WAL/ARIES 트랜잭션 롤백은 구현하지 않음(미래 과제). (5) 실험은 주로 gpt-oss-120b·Qwen3.8-27B에 국한되며 다른 모델·스케일로의 일반성은 미검증임. (6) 생산 환경의 증거(witness) 캡처에는 접근통제·암호화·보존·필드 레벨 마스킹 등 데이터 거버넌스가 필요하지만 본 연구에서는 구현 세부가 없다 (저자 언급).
개발자 관점
- 자가-진화 시스템을 설계할 때 복구 가능성은 전향 성능과 동등한 설계 제약으로 취급해야 하며, 수정(m)을 영구화하기 전 반드시 독립적·반사적(counterfactual) 검증을 실시하라.
- 실제 구현에서는 후보를 ξ=(m,w,u,Ce)로 분리하고 m은 잠가 두어(immutable) 복구 수선이 진정한 회복인지 검증해야 한다(무변조 공격 회피).
- 복구 표현력(recovery language)은 핵심 설계 선택이다: 미들웨어 인덱스·리스너·파일 프리-상태·순서 복구 같은 구조적 프리미티브가 없으면 많은 자연 실패를 절대 수선할 수 없다(L1 필요).
- 진단 그레인(주소 정밀도)은 모델-의존적 설계 변수: 제한된 언어에서 정확 주소(D1)는 큰 이익을 주지만, 표현력이 충분한 경우에는 과도한 정밀 피드백이 합성 전략을 손상시킬 수 있다(모델별 상호작용을 사전 실험하라).
-
실용적 보호장치: 런타임은 E(m,s)=SnapshotDiff∪ExecutionTraceEffects로 독립적 효과 추적을 해야 하며, 선언된 Ce가 관찰된 효과를 누락하면 입장을 거부하도록 설계하라(오버-선언/언더-선언 변조 방지). 실험에서 동적 효과 추적은 300/300으로 의도된 누락을 탐지했다는 점이 참고됨(본문).
-
검증 예산·개발 세트 크기·입장 임계값(τR)은 운영 트레이드오프를 만듦: 개발 세트 다양성·숨김 샘플 수를 늘리면 false positive는 줄지만 수율(coverage)이 감소하므로 제품 요건에 맞춘 임계치 조율이 필요하다(논문의 Q2→Q20, τR 스윕 참조).
-
스토리지·성능: 효과-스코프 스냅샷이 가능한 경우에는 스냅샷이 더 정확·저비용(저용량·저지연)이다(논문 비교: effect-scoped snapshot mean storage 177.8B, latency 0.039ms vs EvoUndo 393.6B, 0.050ms). EvoUndo는 역연산 의미가 없거나 구조적·상태종속 복원이 필요할 때 유용함.
- 보안·거버넌스: 증거(witness) 캡처는 접근통제·암호화·보존정책·레드액션이 필요하니 설계 단계에서 포함시켜야 한다.
근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–22)에 근거해 작성되었다. 모든 정량 수치·설계·실험 프로토콜과 통계치는 본문에 명시된 값을 직접 인용하였다. 부록(Appendix)의 추가 구현·프롬프트·세부 표는 본문에서 참조되었으며 본 요약은 본문과 표/표시된 수치에 기초한다. 본문에 명시되지 않은 내부 코드 구현 세부나 미공개 로그는 포함하지 않았다.