arxiv-wiki

TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories

← 2026-08-07 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 1: Critical error detection requires grounding er-

Figure · 원문 PDF 1쪽 · Figure 1: Critical error detection requires grounding er-

Figure 2: Critical error detection accuracy and local

Figure · 원문 PDF 3쪽 · Figure 2: Critical error detection accuracy and local

Figure 3: An overview of the framework of TRAJDEBUG.

Figure · 원문 PDF 4쪽 · Figure 3: An overview of the framework of TRAJDEBUG.

한 문장 요약

장기간 에이전트 실행 궤적에서 근거 기반 트리거 탐지, 오류 인스턴스 상태 추적(해결/단말영향) 및 후보 집합 기반 인과 귀속을 결합한 TRAJDEBUG로 실패 궤적의 결정적(critical) 오류 단계를 자동 식별한다.

해결하려는 문제

LLM 기반 에이전트의 실패 궤적은 수백 단계에 이르며(장거리 문맥), 오류 판단에 필요한 근거가 멀리 흩어져 있고 동일 궤적에 다수의 지역적 오류가 공존한다. 이로 인해 (1) 개별 오류를 근거있게 식별하기 어렵고, (2) 여러 지역 오류 중 실제 최종 실패를 초래한 결정적 오류만을 가려내기 어렵다. 기존의 범주/제약 기반 방법은 후보를 좁히되 중요성 판정이 취약하고, 인과-귀속 방법은 이후 수리 시도나 피드백으로 인해 판정이 모호해질 수 있다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 이 분석은 사용자에게 제공된 논문 PDF 본문(페이지 1–24의 텍스트)을 기반으로 작성되었음. 표와 본문에 명시된 수치(예: 정확도, TRAJERRBENCH 규모, 평균 스텝 길이, ablation·토큰 사용량 등)는 PDF 본문에서 직접 추출·요약하였다. 다만 논문이 보고한 토큰 소모(예: TRAJDEBUG의 1,382,243 토큰)는 표기된 값이 실험 집합 전체 합계인지 혹은 평균치인지 해석상의 혼동 여지가 있어(본문에서는 ‘평균 토큰 소비’라 표기) 그 점을 명시했음. 나머지 수치와 방법·제한·실험 구성은 본문에 근거해 정리했으며, 본문 밖의 추가 구현·하이퍼파라미터 세부사항은 재구성하지 않았다.