arxiv-wiki

ESPO: Error-Structured Prompt Optimization via Diagnose, Diversify, and Stabilize

← 2026-09-05 목록으로 돌아가기

한 문장 요약

약한 초기 프롬프트에서 발생한 체계적 오류를 한 번에 진단하고(Detect), 네 가지 상이한 제안 전략으로 후보를 다양하게 생성한 뒤(Best-of-K), 부트스트랩 안정성 선택으로 검증하여(Select) 프롬프트 팽창(prompt bloat)과 과적합을 줄이는 ESPO(구성: Diagnose–Propose–Select)를 제안한다.

해결하려는 문제

기존의 반영적 진화형 프롬프트 최적화(예: GEPA)는 반복마다 규칙을 덧붙여 프롬프트가 불필요하게 길어지는 ‘프롬프트 팽창’을 겪는다. 원인은 (1) 훈련 오류의 불완전 관찰(매 라운드 3–8개 오류만 반영하면 체계적 실패 패턴을 충분히 관찰하지 못함), (2) 탐색 편향이 고정된 단일 변이 연산자(탐색 다양성 부족), (3) 작은 검증집합에서의 불안정한 후보 선택(다중 비교 문제)으로, 이로 인해 길이는 증가하지만 일반화 성능은 향상되지 않거나 오히려 악화된다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(메인 텍스트 및 부록)을 근거로 작성되었다. 본문과 부록에 명시된 수치(예: 정확도, 프롬프트 길이, 하이퍼파라미터, 아블레이션 결과 등)를 그대로 인용했으며, 코드·외부 아티팩트나 런타임 환경(하드웨어·정확한 비용 청구 방식) 등 PDF에 명시되지 않은 구현 세부사항은 생성하지 않았다. 일부 실험 수치는 단일 실행(single-run) 또는 3-시드 평균으로 표기된 점이 본문에 혼재하므로, 문맥에 따라 단일-실행 값 또는 평균·표준편차 표기를 그대로 인용했음을 밝힌다.