arxiv-wiki

Trace Integrity for LLM Data Agents: A Vision for Auditable Structured Reasoning in Real-World Systems

← 2026-08-27 목록으로 돌아가기

주요 Figure

원문 PDF에서 실제 Figure 캡션과 그림 영역이 함께 확인된 자료만 자동 추출했다.

Figure 2: Answer Accuracy, Trace Integrity Pass Rate,

Figure · 원문 PDF 5쪽 · Figure 2: Answer Accuracy, Trace Integrity Pass Rate,

Figure 3: Answer-trace quadrants by prompting condition. The lower-left cell is the CAIT case: a correct answer

Figure · 원문 PDF 6쪽 · Figure 3: Answer-trace quadrants by prompting condition. The lower-left cell is the CAIT case: a correct answer

한 문장 요약

구조화된 데이터 질의에서 LLM 데이터 에이전트가 반환한 답변 뒤의 계산이 감사·재실행 가능한지 평가하는 ‘Trace Integrity’ 기준과 이를 운영화하는 실행 계약(execution contracts) 및 CAIT(정답·무효 트레이스) 비율 측정을 제안한다.

해결하려는 문제

기존 평가(정답 정확도)는 엔드 결과만 비교하므로, 동일한 정답이라도 실제로는 잘못된 필터·조인·집계·그루핑·스키마 바인딩 등으로 산출된 ‘무효 트레이스’를 가려내지 못한다. 저자들은 이를 구조적 요구(필터, 조인, 그룹핑, 집계, 시간 창, 스키마 바인딩 등)를 요구하는 작업에서 자연어 추론과 연산자 수준의 프로그램 간 불일치인 ‘Structure Gap’으로 규정하고, 답변 뒤의 계산이 명시적·실행가능·스키마 유효·연산자 충실·재실행 가능·답변 일관·감사 가능해야 한다는 문제를 제기한다.

핵심 기여

접근 방법

주요 결과

한계

개발자 관점

근거 범위: 본 분석은 제공된 논문 PDF 본문(제공된 텍스트 블록, 페이지 1–8)에 근거하여 작성되었음. 표(Table 2)와 본문 수치(Answer Accuracy, Execution Success, Trace Integrity Pass Rate, Answer-Trace Consistency, CAIT Rate, 실행 실패 51건/17.0%)는 PDF 본문에서 직접 인용되었음. 구현 세부사항(검증기 내부 구현, 완전한 의미론적 동등성 검사 알고리즘, 코드·하이퍼파라미터의 구체적 재현 절차 등)은 본문에 상세히 제공되지 않아 해당 부분은 본문에 근거한 범위에서만 기술했음.