arxiv-wiki

SWE-Gate: Passing Functional Tests Is Not Enough for Software Engineering Agents

← 2026-09-05 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Overview of the SWE-Gate construction pipeline. SWE-Gate reconstructs issue–pull request artifacts, uses LLM-

Figure · 원문 PDF 3쪽 · Figure 1: Overview of the SWE-Gate construction pipeline. SWE-Gate reconstructs issue–pull request artifacts, uses LLM-

Figure 2: SWE-Gate benchmark instance schema.

Figure · 원문 PDF 3쪽 · Figure 2: SWE-Gate benchmark instance schema.

한 문장 요약

리뷰에서 도출한 수용 제약(review constraints)을 실행 가능한 테스트로 명시하고, 기능 테스트 통과 여부뿐 아니라 제약 준수를 별도로 평가하는 저장소 수준 소프트웨어 수리 벤치마크 SWE-Gate를 제안하여 LLM 기반 코딩 에이전트의 실무 수용성 평가 격차를 규명한다.

해결하려는 문제

기존의 저장소 수준(Repository-level) 수리 벤치마크들은 주로 PR에 포함된 기능(동작) 테스트의 통과 여부만으로 패치 성공을 판정한다. 그러나 실제 코드 리뷰 과정에서는 호환성, 예외 의미 유지, 리소스 생명주기 등 리뷰에서 제기되는 추가적이고 객관적으로 검증 가능한 수용 제약(review-derived acceptance constraints, 이하 review constraints)이 패치 채택 여부에 큰 영향을 미친다. 기능 테스트 통과만으로는 이러한 리뷰 제약 준수를 보장하지 않으므로 에이전트의 실무 통합 가능성을 과대평가할 위험이 있다. 논문은 이 문제를 해결하기 위해 (1) 리뷰 코멘트에서 제약을 추출하고, (2) 기능 실패와 제약 위반이 분리되어 검증 가능한 인스턴스를 합성·검증하는 방식으로 에이전트를 평가하는 SWE-Gate를 제안한다. 또한 RQ로서 (i) 에이전트의 듀얼(기능·제약) 성능, (ii) 제약 명시 제공의 영향, (iii) 어떤 제약 카테고리가 어려운지를 조사한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 제공된 논문 PDF 본문(페이지 1–11)에 근거하여 작성되었으며, 표와 본문에서 직접 인용 가능한 수치(예: 인스턴스 수 303, 리포지토리 수 75, 표 2/3/4/5의 수치 등)를 사용했습니다. 보조 자료(구체적 전이 매핑, 실험의 단계별 후보 수 등)는 본문에서 참조되지만 PDF에 포함된 보조자료 전문은 제공되지 않아 그 부분의 세부값은 확인하지 못했습니다. 또한 실험은 ‘각 인스턴스당 모델당 한 번의 생성’이라는 본문 언급에 근거하였고, 반복 샘플링에 따른 변동성 분석은 본 논문 본문에 포함되어 있지 않습니다.